360智脑开放平台-官方文档
  1. 更多说明
  • 快速开始
  • 文本生成
    • 对话接口
      • chat/completions(OpenAI格式)
      • messages(Claude格式)
      • Responses API(OpenAI格式)
      • systemone
    • tools工具箱
      • 搜索增强
      • 模板调用
      • 技能分发
      • 网页分析
      • 知识库增强
      • 知识库增强-模板调用
  • 图片生成
    • 生成图片
  • 图片编辑
    • 图片编辑
  • 视频生成
    • seedance素材管理
      • 快速开始
      • 创建素材库
      • 在素材库中创建素材
      • 更新素材库
      • 更新素材
      • 删除素材库
      • 删除素材
      • 查询素材库列表
      • 查询素材库信息
      • 查询素材列表
      • 查询素材信息
      • 查询真人素材库信息
      • 拉起真人认证 H5
    • 创建视频生成
    • 创建视频生成(vidu)
    • 创建视频生成(kling)
    • 创建视频生成(seedance)
    • 查询视频生成状态
  • 音频处理
    • 语音识别(ASR)
    • 语音合成(TTS)
  • 知识库
    • 产品介绍
    • 创建知识库
    • 获取知识库列表
    • 指定知识库获取文档列表
    • 上传文档
    • 获取文档状态
    • 检索知识库
  • AI翻译
    • 产品介绍
      • 文本翻译介绍
      • 图片翻译介绍
      • 文档翻译介绍
      • 错误码说明
    • 文本翻译
    • 图片翻译
    • 文档翻译-创建任务(异步)
    • 文档翻译-获取结果
  • 记忆库
    • 产品介绍
    • 添加记忆
    • 获取记忆结果
    • 检索记忆
    • 获取记忆列表
    • 删除全部记忆
    • 删除单条记忆
  • web搜索(360智搜)
    • 360智搜-基础版(SR)
    • 360智搜-进阶版(PRO)
    • 360智搜-极致版(MAX)
    • 360智搜-新闻
    • 360智搜-精品内容库
    • 360智搜-文搜图
    • 360智搜-图搜图
    • 360智搜-AI搜索
    • 360智搜-新闻垂搜
    • 360智搜-热点资讯
  • AI安全
    • 文本风险检测
    • 图片风险检测
    • 音频风险检测
    • 视频风险检测
    • 查询视频风险检测任务结果
  • 文档解析
    • 文档上传
    • 获取内容
  • 向量化
    • 向量生成
    • 语义相似度计算
  • 更多说明
    • 更优雅地使用本文档
    • 错误码
    • 速率限制
    • 前缀缓存
    • 智能调度
    • 模型发现
      • 模型列表
      • 模型详情
    • 第三方工具配置
      • CC Switch + Claude Code 快速配置
      • CC Switch + Codex快速配置
  • 数据模型
    • Responses API
      • ResponseInputText
      • ResponseInputImage
      • ResponseInputFile
      • ResponseError
      • ResponseConversationParam
      • ResponseIncludable
      • ResponseInputMessageContentList
      • EasyInputMessage
      • ToolChoiceTypes
      • ToolChoiceOptions
      • ToolChoiceMcp
      • ToolChoiceFunction
      • ToolChoiceCustom
      • ToolChoiceApplyPatch
      • ToolChoiceAllowed
      • Message
      • FileCitation
      • ContainerFileCitation
      • URLCitation
      • ToolChoiceShell
      • FilePath
      • ResponseOutputText
      • ResponseOutputRefusal
      • ResponseOutputMessage
    • ErrorResponse
  1. 更多说明

速率限制

什么是速率限制#

速率限制是服务对使用方单位时间内的调用次数和 token 数的限制,也即每分钟可用请求数(Request Per Minute 简称 RPM) 和每分钟可用 token 数(Token Per Minute 简称 TPM)。具体的分模型限制和对应阈值见调用限制。

为什么要做速率限制#

避免对服务的误用或者滥用。如果 apikey 意外泄露,可能会被高频恶意调用,产生不必要的损失。速率限制可以将损失控制在一定范围内。
保障各个业务方能够公平使用服务。如果部分业务方调用频次过高,会对算力资源造成挤占。速率限制可以有效控制这类情况,保障其他业务方服务可用。
保障服务调用量总体可控。通过对各个业务方的调用限制,服务可以保证整体调用量在可控范围内,避免过多调用影响服务性能。

速率限制是怎样做的#

简单来说,rate limit 限制的是最小请求间隔,让调用方对请求进行削峰填谷。
具体来讲,**每分钟可用请求数(Request Per Minute 简称 RPM) 的限制是指两次最小请求间隔不能低于 60/RPM 限额(秒)。比如 RPM 限额是 300 ,则两次最小请求间隔不能低于 60/300(秒) 也就是 0.2 秒。而每分钟可用 token 数(Token Per Minute 简称 TPM)**的限制是任意 60 秒窗口内,模型的输入输出 token 不能超过的值。
打个形象的比方,TPM 和 RPM 就像是游戏的血槽,初始值是最大限额,随着每一次请求消耗(TPM 消耗 token 数,RPM 消耗一次),但是随着跟上一次请求间隔的时间增长直到恢复到原来的限额,TPM 增长的值是 TPM/60 * 间隔秒数,RPM 增长的值是 RPM/60 *间隔秒数 。
速率限制从每分钟可用请求数(Request Per Minute 简称 RPM) 和每分钟可用 token 数(Token Per Minute 简称 TPM)两个维度进行限制。每次请求消耗的请求数超过当前可用请求数或者每次请求消耗的 token 数超过当前可用 token 数,调用请求都会被限制,返回 429 错误。
每次请求消耗的请求数是一,每次请求消耗的 token 数是输入内容占用的 token 数与 max_tokens 参数值的和。
当前可用请求数随时间递增,最大值为每分钟可用请求数。
当前可用 token 数随时间递增,最大值为每分钟可用 token 数。
每次请求时当前可用请求数是上次调用完成后可用的请求数加上两次调用间隔时间内新产生的可用请求数,最大值为每分钟可用请求数。
每次请求时当前可用 token 数是上次调用完成后可用的 token 数加上两次调用间隔时间内新产生的可用 token 数,最大值为每分钟可用 token 数。
两次调用间隔时间内新产生的可用请求数=(本次调用时刻-上次调用时刻)*每分钟可用请求数/60
两次调用间隔时间内新产生的可用 token 数=(本次调用时刻-上次调用时刻)*每分钟可用 token 数/60
举例说明如下:
假定当前设定的每分钟可用请求数是 120,每分钟可用 token 数是 12000。
0ms 时第一次调用,假定消耗 token 是 2000,当前可用请求数是 120,大于 1;当前可用 token 数是 12000,大于 2000,调用可以正常响应。
100ms 时调用,假定消耗 token 是 2000,当前可用请求数是 119,大于 1;当前可用 token 数是 10020,大于 2000,调用可以正常响应。这里 10020 的 token 是因为从上次调用到这次调用间隔的 100ms 内新增了 20 个可用 token。
500ms 时调用,假定消耗 token 是 2000,当前可用请求数是 119,大于 1;当前可用 token 数是 8100,大于 2000,调用可以正常响应。这里 119 的可用次数是因为从第一次调用到这次调用间隔的 500ms 内新增了 1 次可用次数。
600ms 时调用,假定消耗 token 是 6140,当前可用请求数是 118,大于 1;当前可用 token 数是 6120,小于 6140,调用被拦截。
700ms 时调用,假定消耗 token 是 6140,当前可用请求数是 117,大于 1;当前可用 token 数是 6140,等于 6140,调用可以正常响应。
从上面的例子可以看出,当前可用请求数和当前可用 token 数随着时间逐步增加,每次调用时会判断这两个值是否能够满足本次调用,不满足会拦截,随着时间推移,再次满足时会放行。

命中速率限制会如何提示#

命中速率限制后,接口返回的 http 状态码是 429。

业务上如何规避#

控制请求频次和两次请求之间的最小时间间隔,避免短时高频请求。可参考api_request_parallel_processor.py。
调整 max_tokens 参数。速率限制中的 token 数限制用的是输入占用 token 数和 max_tokens 参数指定的 token 数之和,将 max_tokens 适度调小有助于避免命中限制。
使用指数退避算法等方式发起重试。
申请提高限制阈值。

如何提高限制阈值#

联系您的销售代表。
修改于 2026-09-02 07:35:48
上一页
错误码
下一页
前缀缓存
Built with