360智脑开放平台-官方文档
  1. 更多说明
  • 快速开始
  • 文本生成
    • 对话接口
      • chat/completions(OpenAI格式)
      • messages(Claude格式)
      • Responses API(OpenAI格式)
      • systemone
    • tools工具箱
      • 搜索增强
      • 模板调用
      • 技能分发
      • 网页分析
      • 知识库增强
      • 知识库增强-模板调用
  • 图片生成
    • 生成图片
  • 图片编辑
    • 图片编辑
  • 视频生成
    • seedance素材管理
      • 快速开始
      • 创建素材库
      • 在素材库中创建素材
      • 更新素材库
      • 更新素材
      • 删除素材库
      • 删除素材
      • 查询素材库列表
      • 查询素材库信息
      • 查询素材列表
      • 查询素材信息
      • 查询真人素材库信息
      • 拉起真人认证 H5
    • 创建视频生成
    • 创建视频生成(vidu)
    • 创建视频生成(kling)
    • 创建视频生成(seedance)
    • 查询视频生成状态
  • 音频处理
    • 语音识别(ASR)
    • 语音合成(TTS)
  • 知识库
    • 产品介绍
    • 创建知识库
    • 获取知识库列表
    • 指定知识库获取文档列表
    • 上传文档
    • 获取文档状态
    • 检索知识库
  • AI翻译
    • 产品介绍
      • 文本翻译介绍
      • 图片翻译介绍
      • 文档翻译介绍
      • 错误码说明
    • 文本翻译
    • 图片翻译
    • 文档翻译-创建任务(异步)
    • 文档翻译-获取结果
  • 记忆库
    • 产品介绍
    • 添加记忆
    • 获取记忆结果
    • 检索记忆
    • 获取记忆列表
    • 删除全部记忆
    • 删除单条记忆
  • web搜索(360智搜)
    • 360智搜-基础版(SR)
    • 360智搜-进阶版(PRO)
    • 360智搜-极致版(MAX)
    • 360智搜-新闻
    • 360智搜-精品内容库
    • 360智搜-文搜图
    • 360智搜-图搜图
    • 360智搜-AI搜索
    • 360智搜-新闻垂搜
    • 360智搜-热点资讯
  • AI安全
    • 文本风险检测
    • 图片风险检测
    • 音频风险检测
    • 视频风险检测
    • 查询视频风险检测任务结果
  • 文档解析
    • 文档上传
    • 获取内容
  • 向量化
    • 向量生成
    • 语义相似度计算
  • 更多说明
    • 更优雅地使用本文档
    • 错误码
    • 速率限制
    • 前缀缓存
    • 智能调度
    • 模型发现
      • 模型列表
      • 模型详情
    • 第三方工具配置
      • CC Switch + Claude Code 快速配置
      • CC Switch + Codex快速配置
  • 数据模型
    • Responses API
      • ResponseInputText
      • ResponseInputImage
      • ResponseInputFile
      • ResponseError
      • ResponseConversationParam
      • ResponseIncludable
      • ResponseInputMessageContentList
      • EasyInputMessage
      • ToolChoiceTypes
      • ToolChoiceOptions
      • ToolChoiceMcp
      • ToolChoiceFunction
      • ToolChoiceCustom
      • ToolChoiceApplyPatch
      • ToolChoiceAllowed
      • Message
      • FileCitation
      • ContainerFileCitation
      • URLCitation
      • ToolChoiceShell
      • FilePath
      • ResponseOutputText
      • ResponseOutputRefusal
      • ResponseOutputMessage
    • ErrorResponse
  1. 更多说明

前缀缓存

大模型实际应用场景中,输入大模型的 prompt 通常会有一定比例的重复,而对于部分场景如Agent、多轮对话等,更会有大部分的 prompt 前缀是重复的。针对此特点,360 智脑开放平台现已打造上下文缓存系统,对于重复前缀直接从缓存读取,无需重复计算,从而达到显著降低大模型的首字延时。同时对于缓存命中的 token 部分,价格也比原价降低一个数量级,帮助用户大幅削减最终的使用成本!

适用场景#

1.固定的长 system 提示词场景
Agent场景:通常会在 system 提示词中详细描述人设、技能等要求,对于这部分固定的要求可以进行缓存,无需重复计算;
复杂分类场景:对于复杂任务一般需要 fewshot 才能保证模型效果稳定,因而会在 system 详细描述任务并给出若干示例;对于任务描述和示例可以直接读取缓存,无需重复计算。
长文档问答场景:需要输入完整文档给模型作为背景知识,基于此回答用户的各种问题。对于输入的文档内容,可以通过上下文缓存技术从缓存读取,无需重复计算。
2.多轮对话场景
在多轮对话场景,用户会不停与大模型进行互动提问,为了保证大模型能准确理解问题通常都需要会携带多轮历史会话传入模型。这就涉及到很多重复计算。通过上下文缓存技术可以显著减少不必要的重复计算,节省 GPU 资源,提高对话响应速度和用户体验。
3.工具调用场景
在工具调用场景,业务一般会定义很多不能技能的 function,希望模型判断是否调起技能。对于这部分重复输入模型的 function 列表,通过上下文缓存技术可以直接从缓存中读取,无需重复计算,可以显著提高 Agent 响应速度。
Prompt 缓存技术原理图如下:
Prompt缓存技术原理图
增加缓存的收益:
提升服务性能,降低首字延时
对于输入中固定 prompt 较长的请求,增加缓存后,大模型的首字延时将明显降低。
降低整体调用费用
针对命中缓存部分的 token,单价降为原价的十分之一,可显著降低调用成本。

价格说明#

命中缓存部分的价格会在平台的模型卡片内进行展示,如下图所示。
注:截图只标识“模型卡片”的产品形态,模型价格具有时效性,请以合同为准。
image.png

使用缓存服务#

prompt 前缀缓存服务目前已全面上线,用户无需修改代码,无需更换接口,缓存服务将自动运行,系统自动按照实际命中情况计费。
注意,当且仅当两个请求的前缀内容完全相同时(从第 0 个 token 开始相同,且 role 角色也需一致),才算重复。中间开始的重复不能被缓存命中。

查询缓存命中情况#

大模型 API 接口返回字段的 usage 字段中增加 2 个缓存命中相关字段,可通过此字段来查询验证缓存命中情况。
prompt_cache_hit_tokens:本次请求的输入中,命中缓存的 tokens 数
prompt_cache_miss_tokens:本次请求的输入中,未命中缓存的 tokens 数
两个字段的取值之和与 prompt_tokens 取值相等,即为总输入 token 数。
返回的 usage 完整结构如下:

"usage": {

    "prompt_tokens": 425,

    "completion_tokens": 67,

    "total_tokens": 492,

    "prompt_cache_hit_tokens": 320,

    "prompt_cache_miss_tokens": 125

 }
在用量查询页面,您可以看到缓存命中率。
image.png

其他说明#

1.
缓存系统以 16 tokens 为一个存储单元,不足 16 tokens 的内容不会被缓存。
2.
缓存系统总空间大小有限,存储内容超时未被命中会被自动清理,因此不能保证稳定命中缓存,实际命中情况请以接口返回字段为准。(超时时间也不确定,如业务需要稳定的永久缓存,可邮件联系我们进行申请 g-api-service@360.cn。)
3.
命中缓存的价格实时根据真实命中情况计费,计费详情可在用量查询页面查询。
4.
对于非智脑平台部署的供应商模型,缓存tokens以供应商返回的真实计费情况为准。
5.
并非所有模型均已开启缓存,以模型广场展示为准。
修改于 2026-09-02 07:42:44
上一页
速率限制
下一页
智能调度
Built with