Claude Platform Docs
API 参考支持与配置

速率限制

为了减少滥用并管理 API 的容量,我们对组织可以使用 Claude API 的程度设置了限制。

限制分为两种类型:

  1. 支出限制(spend limits)设定了组织每月因 API 使用而产生的最高费用。
  2. 速率限制(rate limits)设定了组织在规定时间段内可以发出的 API 请求的最大数量。

API 在组织级别强制执行服务配置的限制,但您也可以为组织的工作区设置用户可配置的限制。

关于速率限制

  • 限制旨在防止 API 滥用,同时尽量减少对常见客户使用模式的影响。
  • 限制由使用层级(usage tier)定义。组织会根据使用历史和账户状况自动被置于某一层级,并可随着使用 API 的时间推移升至更高层级。
  • 新组织和使用历史有限的组织可能会从 Evaluation(评估)层级开始,在建立账户历史期间,其限制低于本页面所示的标准限制。这些起始限制是 Anthropic 防止欺诈和滥用的措施之一,并会随着您的组织积累使用历史而自动提高。
  • 限制在组织级别设置。您可以在 Claude Console 的速率限制页面查看您组织的层级和当前限制。
  • 您可能会在更短的时间间隔内触及速率限制。例如,每分钟 60 个请求(RPM)的速率可能会按每秒 1 个请求来执行。短时间的请求突发可能会超出限制并触发速率限制错误。
  • 以下限制是每个层级的标准限制。如果您需要更高的限制,请参阅申请更高的限制。
  • API 使用令牌桶算法(token bucket algorithm)进行速率限制。这意味着您的容量会持续补充直至最大限制,而不是在固定间隔重置。
  • 此处描述的所有限制均代表允许的最大使用量,而非保证的最低值。这些限制旨在减少无意的超支,并确保资源在用户之间公平分配。

支出限制

Start、Build 和 Scale 层级各自设有每月支出上限,即您的组织每个日历月可在 API 上花费的最高金额。您可以在账单页面查看您组织的每月支出上限并设置您自己的限制。

使用层级每月支出上限
Start$500 USD
Build$1,000 USD
Scale$200,000 USD

Custom(自定义)层级的组织没有每月支出上限;其限制由客户团队协商安排。

达到支出上限

一旦您达到所在层级的支出上限,API 使用将暂停,直至下个月第一天的 00:00 UTC,除非您提前申请更高的限制。在使用暂停期间,API 请求会返回 HTTP 429:

{
  "type": "error",
  "error": {
    "type": "rate_limit_error",
    "message": "You have reached your API usage limits: your organization has crossed its monthly API usage threshold, set based on your organization's API tier. You will regain access on 2026-09-01 at 00:00 UTC.",
    "details": { "error_code": "enforced_spend_limit_reached" }
  },
  "request_id": "req_018EeWyXxfu5pfWkrYcMdjWG"
}
  • 错误类型为 rate_limit_error,与速率限制相同,但响应中没有 retry-after 标头。在访问恢复之前,重试(包括 SDK 的自动重试)都会失败。
  • 在 Messages API 上,error.details.error_code 为 enforced_spend_limit_reached。可使用它将此响应与速率限制区分开来。
  • 升至更高层级可恢复访问;请参阅申请更高的限制。

设置您自己的支出限制

您还可以设置低于所在层级上限的自定义支出限制以控制成本:

  1. 前往账单页面

    在 Claude Console 中前往设置 > 账单。

  2. 打开支出限制编辑器

    在支出限制部分,点击调整限制(如果当前未设置限制,则点击设置限制)。

  3. 调整您的支出限制

    输入新值。您的支出限制不能超过当前层级的上限。

当使用量达到您设置的支出限制时,请求会返回 HTTP 400,错误类型为 invalid_request_error。消息以 You have reached your specified API usage limits 开头,对于工作区限制则以 You have reached your specified workspace API usage limits 开头,并说明访问何时恢复。提高或移除该限制可更快恢复访问。

Claude Code 工作区上的限制会单独检查:超出该工作区限制的 Claude Code 请求可能会收到带有 retry-after 标头的 429。

速率限制

Messages API 的速率限制按每个模型类别以每分钟请求数(RPM)、每分钟输入令牌数(ITPM)和每分钟输出令牌数(OTPM)来衡量。 如果您超出任何速率限制,您将收到一个 429 错误,说明超出了哪项速率限制,同时附带一个 retry-after 标头,指示需要等待多长时间。

缓存感知的 ITPM

许多 API 提供商使用合并的"每分钟令牌数"(TPM)限制,其中可能包括所有令牌,无论是缓存的还是未缓存的、输入的还是输出的。对于大多数 Claude 模型,只有未缓存的输入令牌计入您的 ITPM 速率限制。 这是一项关键优势,使速率限制实际上比最初看起来更高。

ITPM 速率限制在每个请求开始时进行估算,并在请求过程中调整估算值以反映实际使用的输入令牌数。

以下是计入 ITPM 的内容:

  • input_tokens(最后一个缓存断点之后的令牌)✓ 计入 ITPM
  • cache_creation_input_tokens(正在写入缓存的令牌)✓ 计入 ITPM
  • cache_read_input_tokens(从缓存读取的令牌)✗ 对于大多数模型不计入 ITPM

示例: 在 2,000,000 ITPM 限制和 80% 缓存命中率的情况下,您实际上每分钟可以处理 10,000,000 个总输入令牌(200 万未缓存 + 800 万缓存),因为缓存的令牌不计入您的速率限制。

为了充分利用您的速率限制,请缓存重复内容,例如系统指令和提示、大型上下文文档、工具定义以及对话历史;请参阅提示缓存获取指导。通过有效的缓存,您可以在不提高速率限制的情况下大幅提升实际吞吐量。在使用情况页面监控您的缓存命中率,以调整您的缓存策略。

OTPM 速率限制在输出令牌生成时实时评估,仅计算实际生成的令牌。max_tokens 参数不纳入 OTPM 速率限制计算,因此设置更高的 max_tokens 值在速率限制方面没有任何不利影响。

速率限制针对每个模型单独应用;因此您可以同时使用不同的模型,直至各自的限制。 您可以在 Claude Console 的速率限制页面查看您当前的速率限制和行为,或使用 Rate Limits API 以编程方式读取已配置的限制。

模型每分钟最大请求数(RPM)每分钟最大输入令牌数(ITPM)每分钟最大输出令牌数(OTPM)
Claude Fable 5.x11,000500,000100,000
Claude Opus 5.51,0002,000,000400,000
Claude Opus 51,0002,000,000400,000
Claude Opus 4.x21,0002,000,000400,000
Claude Sonnet 51,0002,000,000400,000
Claude Sonnet 4.x31,0002,000,000400,000
Claude Haiku 4.51,0002,000,000400,000
Claude Haiku 3.5(已停用,Bedrock 和 Google Cloud 除外)1,000100,000420,000

1 Fable 速率限制是一项总限制,适用于 Claude Fable 5.1 和 Claude Fable 5 的合并流量。Claude Mythos 5.1 和 Claude Mythos 5 按相同条款共享另一项单独的合并限制。

2 Opus 速率限制是一项总限制,适用于 Claude Opus 4.8、Opus 4.7、Opus 4.6 和 Opus 4.5 的合并流量。Claude Opus 5.5 和 Claude Opus 5 各自有单独的速率限制,不属于此合并桶。

3 Sonnet 4.x 速率限制是一项总限制,适用于 Sonnet 4.6 和 Sonnet 4.5 的合并流量。Claude Sonnet 5 有单独的速率限制,不属于此合并桶。

4 该限制将 cache_read_input_tokens 计入 ITPM 使用量。

Message Batches API

Message Batches API 有自己的一套速率限制,在所有模型之间共享。其中包括适用于所有 API 端点的每分钟请求数(RPM)限制,以及对可同时处于处理队列中的批处理请求数量的限制。此处的"批处理请求"指 Message Batch 的一部分。您可以创建一个包含数千个批处理请求的 Message Batch,其中每个请求都计入此限制。当批处理请求尚未被模型成功处理时,即被视为处理队列的一部分。

每分钟最大请求数(RPM)处理队列中的最大批处理请求数每批最大批处理请求数
1,000200,000100,000

Managed Agents

Claude Managed Agents 端点按组织进行速率限制。这些限制与上述 Messages API 速率限制相互独立。

操作限制
创建类端点(例如 agents、sessions 和 environments)每分钟 300 个请求
读取类端点(例如 retrieve、list 和 stream)每分钟 1,200 个请求

Files API

Files API 请求有自己的按组织限制,在上传、列出、检索、下载和删除操作之间共享,并与本页面前文所述的 Messages API 限制相互独立。当前数值请参阅 Files API 速率限制。

快速模式速率限制

在 Claude Opus 5.5、Claude Opus 5,或 Opus 4.8 上通过 speed: "fast" 使用快速模式(研究预览版)时,将适用独立于标准 Opus 速率限制的专用速率限制。当超出快速模式速率限制时,API 会返回带有 retry-after 标头的 429 错误。快速模式在 Claude Opus 4.7 上不可用(请求会返回错误),在 Claude Opus 4.6 上也不可用(对 claude-opus-4-6 使用 speed: "fast" 的请求会以标准速度运行)。请参阅快速模式。

响应中包含 anthropic-fast-* 标头,用于指示您的快速模式速率限制状态。有关这些标头的详情,请参阅快速模式速率限制。

在 Console 中监控您的速率限制

您可以在 Claude Console 的使用情况页面监控您的速率限制使用情况。

除了提供令牌和请求图表外,使用情况页面还提供两个单独的速率限制图表。使用这些图表可以了解您还有多少增长空间、识别何时可能达到使用高峰、了解应申请哪些速率限制,以及学习如何提高缓存率。这些图表针对给定的速率限制(例如按模型)可视化展示多项指标:

  • Rate Limit - Input Tokens(速率限制 - 输入令牌)图表包括:
    • 每小时的每分钟未缓存输入令牌数最大值
    • 您当前的每分钟输入令牌数速率限制
    • 您输入令牌的缓存率(即从缓存读取的输入令牌百分比)
  • Rate Limit - Output Tokens(速率限制 - 输出令牌)图表包括:
    • 每小时的每分钟输出令牌数最大值
    • 您当前的每分钟输出令牌数速率限制

申请更高的限制

如需申请更高的速率限制或更高的每月支出上限,请使用速率限制页面上的 Request rate limit increase(申请提高速率限制)。Anthropic 支持团队也可以提高限制;如有紧急需求,请联系 Anthropic 支持团队。

为工作区设置更低的限制

有关工作区的更多信息,请参阅工作区。

为了保护您组织中的工作区免受潜在的过度使用,您可以为每个工作区设置自定义的支出限制和速率限制。

示例:如果您组织的限制为每分钟 40,000 个输入令牌和每分钟 8,000 个输出令牌,您可以将某个工作区限制为每分钟 30,000 个输入令牌。这可以保护其他工作区免受潜在的过度使用,并确保资源在您的组织内更公平地分配。剩余未使用的每分钟令牌数(如果该工作区未用满限制,则会更多)可供其他工作区使用。

注意:

  • 您无法对默认工作区设置限制。
  • 如果未设置,工作区限制与组织的限制一致。
  • 工作区限制按限制器类型设置(例如每分钟请求数、每分钟输入令牌数或每分钟输出令牌数)。
  • 组织范围的限制始终适用,即使各工作区限制之和更高。

如需以编程方式读取您当前的组织和工作区速率限制,请使用 Rate Limits API。

响应标头

API 响应中包含的标头会向您显示所执行的速率限制、当前使用情况以及限制何时重置。

返回以下标头:

标头描述
retry-after在可以重试请求之前需要等待的秒数。提前重试将会失败。支出上限 429 不会发送此标头(请参阅达到支出上限)。
anthropic-ratelimit-requests-limit任意速率限制周期内允许的最大请求数。
anthropic-ratelimit-requests-remaining在被速率限制之前剩余的请求数。
anthropic-ratelimit-requests-reset请求速率限制完全补充的时间,以 RFC 3339 格式提供。
anthropic-ratelimit-tokens-limit任意速率限制周期内允许的最大令牌数。
anthropic-ratelimit-tokens-remaining在被速率限制之前剩余的令牌数(四舍五入到最接近的千位)。
anthropic-ratelimit-tokens-reset令牌速率限制完全补充的时间,以 RFC 3339 格式提供。
anthropic-ratelimit-input-tokens-limit任意速率限制周期内允许的最大输入令牌数。
anthropic-ratelimit-input-tokens-remaining在被速率限制之前剩余的输入令牌数(四舍五入到最接近的千位)。
anthropic-ratelimit-input-tokens-reset输入令牌速率限制完全补充的时间,以 RFC 3339 格式提供。
anthropic-ratelimit-output-tokens-limit任意速率限制周期内允许的最大输出令牌数。
anthropic-ratelimit-output-tokens-remaining在被速率限制之前剩余的输出令牌数(四舍五入到最接近的千位)。
anthropic-ratelimit-output-tokens-reset输出令牌速率限制完全补充的时间,以 RFC 3339 格式提供。
anthropic-priority-input-tokens-limit任意速率限制周期内允许的最大 Priority Tier 输入令牌数。(仅限 Priority Tier)
anthropic-priority-input-tokens-remaining在被速率限制之前剩余的 Priority Tier 输入令牌数(四舍五入到最接近的千位)。(仅限 Priority Tier)
anthropic-priority-input-tokens-resetPriority Tier 输入令牌速率限制完全补充的时间,以 RFC 3339 格式提供。(仅限 Priority Tier)
anthropic-priority-output-tokens-limit任意速率限制周期内允许的最大 Priority Tier 输出令牌数。(仅限 Priority Tier)
anthropic-priority-output-tokens-remaining在被速率限制之前剩余的 Priority Tier 输出令牌数(四舍五入到最接近的千位)。(仅限 Priority Tier)
anthropic-priority-output-tokens-resetPriority Tier 输出令牌速率限制完全补充的时间,以 RFC 3339 格式提供。(仅限 Priority Tier)

anthropic-ratelimit-tokens-* 标头显示当前生效的最严格限制的值。例如,如果您超出了工作区每分钟令牌限制,这些标头将包含工作区每分钟令牌速率限制的值。如果工作区限制不适用,这些标头将返回剩余的总令牌数,其中总数为输入令牌和输出令牌之和。这种方式可确保您能够了解当前 API 使用中最相关的约束。要查看某个请求计入了哪个工作区,请读取 anthropic-workspace-id 响应标头,其中包含您的 API 密钥或访问令牌所解析到的工作区 ID。

Was this page helpful?