Claude Platform Docs
API 参考支持与配置

服务层级

不同的服务层级让您能够根据应用程序的需求,在可用性、性能和可预测的成本之间取得平衡。

Anthropic 提供三种服务层级:

  • Priority Tier(优先层级): 仅适用于已有容量承诺的组织
  • Standard(标准层级): 默认层级,适用于日常用例的试点和规模化扩展
  • Batch(批处理层级): 最适合可以等待、或能从脱离您的常规容量中获益的异步工作流

标准层级

标准层级是所有 API 请求的默认服务层级。API 会以尽力而为的可用性,将这些请求与所有其他请求一同进行优先级处理。

Priority Tier

API 会将此层级中的请求优先于所有其他请求进行处理。这种优先处理有助于最大限度地减少"服务器过载"错误,即使在高峰时段也是如此。

有关更多信息,请参阅现有 Priority Tier 承诺。

请求如何被分配层级

在处理请求时,Anthropic 会在以下情况下决定将请求分配到 Priority Tier:

  • 您的组织拥有足够的 Priority Tier 容量每分钟输入令牌
  • 您的组织拥有足够的 Priority Tier 容量每分钟输出令牌

Anthropic 按如下方式将用量计入 Priority Tier 容量:

输入令牌

  • 缓存读取:从缓存中读取的每个令牌计为 0.1 个令牌
  • 缓存写入:以 5 分钟 TTL 写入缓存的每个令牌计为 1.25 个令牌
  • 缓存写入:以 1 小时 TTL 写入缓存的每个令牌计为 2.00 个令牌
  • 对于在 Claude 4.6 及更高版本模型上的仅限美国推理(inference_geo: "us")请求,每个输入令牌计为 1.1 个令牌
  • 所有其他输入令牌均为每个令牌计为 1 个令牌

输出令牌

  • 对于在 Claude 4.6 及更高版本模型上的仅限美国推理(inference_geo: "us")请求,每个输出令牌计为 1.1 个令牌
  • 所有其他输出令牌均为每个令牌计为 1 个令牌

否则,请求将按标准层级处理。

使用服务层级

您可以通过设置 service_tier 参数来控制请求可以使用哪些服务层级:

client = anthropic.Anthropic()

message = client.messages.create(
    model="claude-opus-4-8",
    max_tokens=1024,
    messages=[{"role": "user", "content": "Hello, Claude!"}],
    service_tier="auto",  # Automatically use Priority Tier when available, fallback to standard
)
print(message.usage.service_tier)

service_tier 参数接受以下值:

  • "auto"(默认)- 如果可用则使用 Priority Tier 容量,否则回退到您的其他容量
  • "standard_only" - 仅使用标准层级容量,如果您不想使用 Priority Tier 容量,这会很有用

响应的 usage 对象还包含分配给该请求的服务层级:

{
  "usage": {
    "input_tokens": 410,
    "cache_creation_input_tokens": 0,
    "cache_read_input_tokens": 0,
    "output_tokens": 585,
    "service_tier": "priority"
  }
}

这使您能够确定请求被分配到了哪个服务层级。

当对具有 Priority Tier 承诺的模型请求 service_tier="auto" 时,以下响应头会提供相关信息:

anthropic-priority-input-tokens-limit: 10000
anthropic-priority-input-tokens-remaining: 9618
anthropic-priority-input-tokens-reset: 2025-01-12T23:11:59Z
anthropic-priority-output-tokens-limit: 10000
anthropic-priority-output-tokens-remaining: 6000
anthropic-priority-output-tokens-reset: 2025-01-12T23:12:21Z

您可以通过这些响应头是否存在来检测您的请求是否符合 Priority Tier 的条件,即使它已超出限制。

现有 Priority Tier 承诺

Priority Tier 承诺包括:

  • 每分钟输入令牌数量
  • 每分钟输出令牌数量
  • 承诺期限(1、3、6 或 12 个月)
  • 特定的模型版本

Priority Tier 以优先的计算资源为目标实现 99.5% 的正常运行时间。超出您承诺容量的请求会自动回退到标准层级。

支持的模型

除 Claude Fable 5.1、Claude Mythos 5.1、Claude Mythos 5、Claude Mythos Preview、Claude Opus 5.5、Claude Opus 5 和 Claude Sonnet 5 之外,所有可用的 Claude 模型均支持 Priority Tier。

请查看模型概览了解有关可用模型的更多详情。

Was this page helpful?