速率限制
为了减少滥用并管理 API 的容量,我们对组织可以使用 Claude API 的程度设置了限制。
限制分为两种类型:
- 支出限制(spend limits)设定了组织每月因 API 使用而产生的最高费用。
- 速率限制(rate limits)设定了组织在规定时间段内可以发出的 API 请求的最大数量。
API 在组织级别强制执行服务配置的限制,但您也可以为组织的工作区设置用户可配置的限制。
关于速率限制
- 限制旨在防止 API 滥用,同时尽量减少对常见客户使用模式的影响。
- 限制由使用层级(usage tier)定义。组织会根据使用历史和账户状况自动被置于某一层级,并可随着使用 API 的时间推移升至更高层级。
- 新组织和使用历史有限的组织可能会从 Evaluation(评估)层级开始,在建立账户历史期间,其限制低于本页面所示的标准限制。这些起始限制是 Anthropic 防止欺诈和滥用的措施之一,并会随着您的组织积累使用历史而自动提高。
- 限制在组织级别设置。您可以在 Claude Console 的速率限制页面查看您组织的层级和当前限制。
- 您可能会在更短的时间间隔内触及速率限制。例如,每分钟 60 个请求(RPM)的速率可能会按每秒 1 个请求来执行。短时间的请求突发可能会超出限制并触发速率限制错误。
- 以下限制是每个层级的标准限制。如果您需要更高的限制,请参阅申请更高的限制。
- API 使用令牌桶算法(token bucket algorithm)进行速率限制。这意味着您的容量会持续补充直至最大限制,而不是在固定间隔重置。
- 此处描述的所有限制均代表允许的最大使用量,而非保证的最低值。这些限制旨在减少无意的超支,并确保资源在用户之间公平分配。
支出限制
Start、Build 和 Scale 层级各自设有每月支出上限,即您的组织每个日历月可在 API 上花费的最高金额。您可以在账单页面查看您组织的每月支出上限并设置您自己的限制。
| 使用层级 | 每月支出上限 |
|---|---|
| Start | $500 USD |
| Build | $1,000 USD |
| Scale | $200,000 USD |
Custom(自定义)层级的组织没有每月支出上限;其限制由客户团队协商安排。
达到支出上限
一旦您达到所在层级的支出上限,API 使用将暂停,直至下个月第一天的 00:00 UTC,除非您提前申请更高的限制。在使用暂停期间,API 请求会返回 HTTP 429:
{
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "You have reached your API usage limits: your organization has crossed its monthly API usage threshold, set based on your organization's API tier. You will regain access on 2026-09-01 at 00:00 UTC.",
"details": { "error_code": "enforced_spend_limit_reached" }
},
"request_id": "req_018EeWyXxfu5pfWkrYcMdjWG"
}- 错误类型为
rate_limit_error,与速率限制相同,但响应中没有retry-after标头。在访问恢复之前,重试(包括 SDK 的自动重试)都会失败。 - 在 Messages API 上,
error.details.error_code为enforced_spend_limit_reached。可使用它将此响应与速率限制区分开来。 - 升至更高层级可恢复访问;请参阅申请更高的限制。
设置您自己的支出限制
您还可以设置低于所在层级上限的自定义支出限制以控制成本:
前往账单页面
在 Claude Console 中前往设置 > 账单。
打开支出限制编辑器
在支出限制部分,点击调整限制(如果当前未设置限制,则点击设置限制)。
调整您的支出限制
输入新值。您的支出限制不能超过当前层级的上限。
当使用量达到您设置的支出限制时,请求会返回 HTTP 400,错误类型为 invalid_request_error。消息以 You have reached your specified API usage limits 开头,对于工作区限制则以 You have reached your specified workspace API usage limits 开头,并说明访问何时恢复。提高或移除该限制可更快恢复访问。
Claude Code 工作区上的限制会单独检查:超出该工作区限制的 Claude Code 请求可能会收到带有 retry-after 标头的 429。
速率限制
Messages API 的速率限制按每个模型类别以每分钟请求数(RPM)、每分钟输入令牌数(ITPM)和每分钟输出令牌数(OTPM)来衡量。
如果您超出任何速率限制,您将收到一个 429 错误,说明超出了哪项速率限制,同时附带一个 retry-after 标头,指示需要等待多长时间。
缓存感知的 ITPM
许多 API 提供商使用合并的"每分钟令牌数"(TPM)限制,其中可能包括所有令牌,无论是缓存的还是未缓存的、输入的还是输出的。对于大多数 Claude 模型,只有未缓存的输入令牌计入您的 ITPM 速率限制。 这是一项关键优势,使速率限制实际上比最初看起来更高。
ITPM 速率限制在每个请求开始时进行估算,并在请求过程中调整估算值以反映实际使用的输入令牌数。
以下是计入 ITPM 的内容:
input_tokens(最后一个缓存断点之后的令牌)✓ 计入 ITPMcache_creation_input_tokens(正在写入缓存的令牌)✓ 计入 ITPMcache_read_input_tokens(从缓存读取的令牌)✗ 对于大多数模型不计入 ITPM
示例: 在 2,000,000 ITPM 限制和 80% 缓存命中率的情况下,您实际上每分钟可以处理 10,000,000 个总输入令牌(200 万未缓存 + 800 万缓存),因为缓存的令牌不计入您的速率限制。
为了充分利用您的速率限制,请缓存重复内容,例如系统指令和提示、大型上下文文档、工具定义以及对话历史;请参阅提示缓存获取指导。通过有效的缓存,您可以在不提高速率限制的情况下大幅提升实际吞吐量。在使用情况页面监控您的缓存命中率,以调整您的缓存策略。
OTPM 速率限制在输出令牌生成时实时评估,仅计算实际生成的令牌。max_tokens 参数不纳入 OTPM 速率限制计算,因此设置更高的 max_tokens 值在速率限制方面没有任何不利影响。
速率限制针对每个模型单独应用;因此您可以同时使用不同的模型,直至各自的限制。 您可以在 Claude Console 的速率限制页面查看您当前的速率限制和行为,或使用 Rate Limits API 以编程方式读取已配置的限制。
| 模型 | 每分钟最大请求数(RPM) | 每分钟最大输入令牌数(ITPM) | 每分钟最大输出令牌数(OTPM) |
|---|---|---|---|
| Claude Fable 5.x1 | 1,000 | 500,000 | 100,000 |
| Claude Opus 5.5 | 1,000 | 2,000,000 | 400,000 |
| Claude Opus 5 | 1,000 | 2,000,000 | 400,000 |
| Claude Opus 4.x2 | 1,000 | 2,000,000 | 400,000 |
| Claude Sonnet 5 | 1,000 | 2,000,000 | 400,000 |
| Claude Sonnet 4.x3 | 1,000 | 2,000,000 | 400,000 |
| Claude Haiku 4.5 | 1,000 | 2,000,000 | 400,000 |
| Claude Haiku 3.5(已停用,Bedrock 和 Google Cloud 除外) | 1,000 | 100,0004 | 20,000 |
1 Fable 速率限制是一项总限制,适用于 Claude Fable 5.1 和 Claude Fable 5 的合并流量。Claude Mythos 5.1 和 Claude Mythos 5 按相同条款共享另一项单独的合并限制。
2 Opus 速率限制是一项总限制,适用于 Claude Opus 4.8、Opus 4.7、Opus 4.6 和 Opus 4.5 的合并流量。Claude Opus 5.5 和 Claude Opus 5 各自有单独的速率限制,不属于此合并桶。
3 Sonnet 4.x 速率限制是一项总限制,适用于 Sonnet 4.6 和 Sonnet 4.5 的合并流量。Claude Sonnet 5 有单独的速率限制,不属于此合并桶。
4 该限制将 cache_read_input_tokens 计入 ITPM 使用量。
Message Batches API
Message Batches API 有自己的一套速率限制,在所有模型之间共享。其中包括适用于所有 API 端点的每分钟请求数(RPM)限制,以及对可同时处于处理队列中的批处理请求数量的限制。此处的"批处理请求"指 Message Batch 的一部分。您可以创建一个包含数千个批处理请求的 Message Batch,其中每个请求都计入此限制。当批处理请求尚未被模型成功处理时,即被视为处理队列的一部分。
| 每分钟最大请求数(RPM) | 处理队列中的最大批处理请求数 | 每批最大批处理请求数 |
|---|---|---|
| 1,000 | 200,000 | 100,000 |
Managed Agents
Claude Managed Agents 端点按组织进行速率限制。这些限制与上述 Messages API 速率限制相互独立。
| 操作 | 限制 |
|---|---|
| 创建类端点(例如 agents、sessions 和 environments) | 每分钟 300 个请求 |
| 读取类端点(例如 retrieve、list 和 stream) | 每分钟 1,200 个请求 |
Files API
Files API 请求有自己的按组织限制,在上传、列出、检索、下载和删除操作之间共享,并与本页面前文所述的 Messages API 限制相互独立。当前数值请参阅 Files API 速率限制。
快速模式速率限制
在 Claude Opus 5.5、Claude Opus 5,或 Opus 4.8 上通过 speed: "fast" 使用快速模式(研究预览版)时,将适用独立于标准 Opus 速率限制的专用速率限制。当超出快速模式速率限制时,API 会返回带有 retry-after 标头的 429 错误。快速模式在 Claude Opus 4.7 上不可用(请求会返回错误),在 Claude Opus 4.6 上也不可用(对 claude-opus-4-6 使用 speed: "fast" 的请求会以标准速度运行)。请参阅快速模式。
响应中包含 anthropic-fast-* 标头,用于指示您的快速模式速率限制状态。有关这些标头的详情,请参阅快速模式速率限制。
在 Console 中监控您的速率限制
您可以在 Claude Console 的使用情况页面监控您的速率限制使用情况。
除了提供令牌和请求图表外,使用情况页面还提供两个单独的速率限制图表。使用这些图表可以了解您还有多少增长空间、识别何时可能达到使用高峰、了解应申请哪些速率限制,以及学习如何提高缓存率。这些图表针对给定的速率限制(例如按模型)可视化展示多项指标:
- Rate Limit - Input Tokens(速率限制 - 输入令牌)图表包括:
- 每小时的每分钟未缓存输入令牌数最大值
- 您当前的每分钟输入令牌数速率限制
- 您输入令牌的缓存率(即从缓存读取的输入令牌百分比)
- Rate Limit - Output Tokens(速率限制 - 输出令牌)图表包括:
- 每小时的每分钟输出令牌数最大值
- 您当前的每分钟输出令牌数速率限制
申请更高的限制
如需申请更高的速率限制或更高的每月支出上限,请使用速率限制页面上的 Request rate limit increase(申请提高速率限制)。Anthropic 支持团队也可以提高限制;如有紧急需求,请联系 Anthropic 支持团队。
为工作区设置更低的限制
有关工作区的更多信息,请参阅工作区。
为了保护您组织中的工作区免受潜在的过度使用,您可以为每个工作区设置自定义的支出限制和速率限制。
示例:如果您组织的限制为每分钟 40,000 个输入令牌和每分钟 8,000 个输出令牌,您可以将某个工作区限制为每分钟 30,000 个输入令牌。这可以保护其他工作区免受潜在的过度使用,并确保资源在您的组织内更公平地分配。剩余未使用的每分钟令牌数(如果该工作区未用满限制,则会更多)可供其他工作区使用。
注意:
- 您无法对默认工作区设置限制。
- 如果未设置,工作区限制与组织的限制一致。
- 工作区限制按限制器类型设置(例如每分钟请求数、每分钟输入令牌数或每分钟输出令牌数)。
- 组织范围的限制始终适用,即使各工作区限制之和更高。
如需以编程方式读取您当前的组织和工作区速率限制,请使用 Rate Limits API。
响应标头
API 响应中包含的标头会向您显示所执行的速率限制、当前使用情况以及限制何时重置。
返回以下标头:
| 标头 | 描述 |
|---|---|
retry-after | 在可以重试请求之前需要等待的秒数。提前重试将会失败。支出上限 429 不会发送此标头(请参阅达到支出上限)。 |
anthropic-ratelimit-requests-limit | 任意速率限制周期内允许的最大请求数。 |
anthropic-ratelimit-requests-remaining | 在被速率限制之前剩余的请求数。 |
anthropic-ratelimit-requests-reset | 请求速率限制完全补充的时间,以 RFC 3339 格式提供。 |
anthropic-ratelimit-tokens-limit | 任意速率限制周期内允许的最大令牌数。 |
anthropic-ratelimit-tokens-remaining | 在被速率限制之前剩余的令牌数(四舍五入到最接近的千位)。 |
anthropic-ratelimit-tokens-reset | 令牌速率限制完全补充的时间,以 RFC 3339 格式提供。 |
anthropic-ratelimit-input-tokens-limit | 任意速率限制周期内允许的最大输入令牌数。 |
anthropic-ratelimit-input-tokens-remaining | 在被速率限制之前剩余的输入令牌数(四舍五入到最接近的千位)。 |
anthropic-ratelimit-input-tokens-reset | 输入令牌速率限制完全补充的时间,以 RFC 3339 格式提供。 |
anthropic-ratelimit-output-tokens-limit | 任意速率限制周期内允许的最大输出令牌数。 |
anthropic-ratelimit-output-tokens-remaining | 在被速率限制之前剩余的输出令牌数(四舍五入到最接近的千位)。 |
anthropic-ratelimit-output-tokens-reset | 输出令牌速率限制完全补充的时间,以 RFC 3339 格式提供。 |
anthropic-priority-input-tokens-limit | 任意速率限制周期内允许的最大 Priority Tier 输入令牌数。(仅限 Priority Tier) |
anthropic-priority-input-tokens-remaining | 在被速率限制之前剩余的 Priority Tier 输入令牌数(四舍五入到最接近的千位)。(仅限 Priority Tier) |
anthropic-priority-input-tokens-reset | Priority Tier 输入令牌速率限制完全补充的时间,以 RFC 3339 格式提供。(仅限 Priority Tier) |
anthropic-priority-output-tokens-limit | 任意速率限制周期内允许的最大 Priority Tier 输出令牌数。(仅限 Priority Tier) |
anthropic-priority-output-tokens-remaining | 在被速率限制之前剩余的 Priority Tier 输出令牌数(四舍五入到最接近的千位)。(仅限 Priority Tier) |
anthropic-priority-output-tokens-reset | Priority Tier 输出令牌速率限制完全补充的时间,以 RFC 3339 格式提供。(仅限 Priority Tier) |
anthropic-ratelimit-tokens-* 标头显示当前生效的最严格限制的值。例如,如果您超出了工作区每分钟令牌限制,这些标头将包含工作区每分钟令牌速率限制的值。如果工作区限制不适用,这些标头将返回剩余的总令牌数,其中总数为输入令牌和输出令牌之和。这种方式可确保您能够了解当前 API 使用中最相关的约束。要查看某个请求计入了哪个工作区,请读取 anthropic-workspace-id 响应标头,其中包含您的 API 密钥或访问令牌所解析到的工作区 ID。
Was this page helpful?