服务层级
不同的服务层级让您能够根据应用程序的需求,在可用性、性能和可预测的成本之间取得平衡。
Anthropic 提供三种服务层级:
- Priority Tier(优先层级): 仅适用于已有容量承诺的组织
- Standard(标准层级): 默认层级,适用于日常用例的试点和规模化扩展
- Batch(批处理层级): 最适合可以等待、或能从脱离您的常规容量中获益的异步工作流
标准层级
标准层级是所有 API 请求的默认服务层级。API 会以尽力而为的可用性,将这些请求与所有其他请求一同进行优先级处理。
Priority Tier
API 会将此层级中的请求优先于所有其他请求进行处理。这种优先处理有助于最大限度地减少"服务器过载"错误,即使在高峰时段也是如此。
有关更多信息,请参阅现有 Priority Tier 承诺。
请求如何被分配层级
在处理请求时,Anthropic 会在以下情况下决定将请求分配到 Priority Tier:
- 您的组织拥有足够的 Priority Tier 容量每分钟输入令牌
- 您的组织拥有足够的 Priority Tier 容量每分钟输出令牌
Anthropic 按如下方式将用量计入 Priority Tier 容量:
输入令牌
- 缓存读取:从缓存中读取的每个令牌计为 0.1 个令牌
- 缓存写入:以 5 分钟 TTL 写入缓存的每个令牌计为 1.25 个令牌
- 缓存写入:以 1 小时 TTL 写入缓存的每个令牌计为 2.00 个令牌
- 对于在 Claude 4.6 及更高版本模型上的仅限美国推理(
inference_geo: "us")请求,每个输入令牌计为 1.1 个令牌 - 所有其他输入令牌均为每个令牌计为 1 个令牌
输出令牌
- 对于在 Claude 4.6 及更高版本模型上的仅限美国推理(
inference_geo: "us")请求,每个输出令牌计为 1.1 个令牌 - 所有其他输出令牌均为每个令牌计为 1 个令牌
否则,请求将按标准层级处理。
使用服务层级
您可以通过设置 service_tier 参数来控制请求可以使用哪些服务层级:
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-opus-4-8",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello, Claude!"}],
service_tier="auto", # Automatically use Priority Tier when available, fallback to standard
)
print(message.usage.service_tier)service_tier 参数接受以下值:
"auto"(默认)- 如果可用则使用 Priority Tier 容量,否则回退到您的其他容量"standard_only"- 仅使用标准层级容量,如果您不想使用 Priority Tier 容量,这会很有用
响应的 usage 对象还包含分配给该请求的服务层级:
{
"usage": {
"input_tokens": 410,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0,
"output_tokens": 585,
"service_tier": "priority"
}
}这使您能够确定请求被分配到了哪个服务层级。
当对具有 Priority Tier 承诺的模型请求 service_tier="auto" 时,以下响应头会提供相关信息:
anthropic-priority-input-tokens-limit: 10000
anthropic-priority-input-tokens-remaining: 9618
anthropic-priority-input-tokens-reset: 2025-01-12T23:11:59Z
anthropic-priority-output-tokens-limit: 10000
anthropic-priority-output-tokens-remaining: 6000
anthropic-priority-output-tokens-reset: 2025-01-12T23:12:21Z您可以通过这些响应头是否存在来检测您的请求是否符合 Priority Tier 的条件,即使它已超出限制。
现有 Priority Tier 承诺
Priority Tier 承诺包括:
- 每分钟输入令牌数量
- 每分钟输出令牌数量
- 承诺期限(1、3、6 或 12 个月)
- 特定的模型版本
Priority Tier 以优先的计算资源为目标实现 99.5% 的正常运行时间。超出您承诺容量的请求会自动回退到标准层级。
支持的模型
除 Claude Fable 5.1、Claude Mythos 5.1、Claude Mythos 5、Claude Mythos Preview、Claude Opus 5.5、Claude Opus 5 和 Claude Sonnet 5 之外,所有可用的 Claude 模型均支持 Priority Tier。
请查看模型概览了解有关可用模型的更多详情。
Was this page helpful?