Priority Tier 容量承诺已不再提供购买。拥有现有承诺的组织可以在其合同结束日期之前继续使用 Priority Tier,本页面将继续作为参考供其使用。如果您需要有保障的容量,请联系销售。
Anthropic 提供三种服务层级:
标准层级是所有 API 请求的默认服务层级。API 会以尽力而为的可用性将这些请求与所有其他请求一起进行优先级排序。
API 会优先处理此层级中的请求,优先于所有其他请求。这种优先级排序有助于最大限度地减少"服务器过载"错误,即使在高峰时段也是如此。
有关更多信息,请参阅现有 Priority Tier 承诺。
在处理请求时,Anthropic 会在以下情况下决定将请求分配到 Priority Tier:
Anthropic 按如下方式计算 Priority Tier 容量的使用量:
输入令牌
inference_geo: "us")请求,输入令牌按每个令牌计为 1.1 个令牌输出令牌
inference_geo: "us")请求,输出令牌按每个令牌计为 1.1 个令牌否则,请求将按标准层级处理。
这些消耗率反映了每种令牌类型的相对定价。例如,在 Claude 4.6 及更高版本模型上,仅限美国推理的定价为 1.1 倍,因此使用 inference_geo: "us" 消耗的每个令牌会从您的 Priority Tier 容量中扣除 1.1 个令牌。
分配到 Priority Tier 的请求会同时从 Priority Tier 容量和常规速率限制中扣除。 如果处理该请求会超出速率限制,则该请求将被拒绝。
您可以通过设置 service_tier 参数来控制请求可以使用哪些服务层级:
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-opus-4-8",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello, Claude!"}],
service_tier="auto", # Automatically use Priority Tier when available, fallback to standard
)
print(message.usage.service_tier)service_tier 参数接受以下值:
"auto"(默认)- 如果 Priority Tier 容量可用则使用它,否则回退到您的其他容量"standard_only" - 仅使用标准层级容量,如果您不想使用 Priority Tier 容量,这会很有用响应的 usage 对象还包含分配给该请求的服务层级:
{
"usage": {
"input_tokens": 410,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0,
"output_tokens": 585,
"service_tier": "priority"
}
}这使您可以确定请求被分配到了哪个服务层级。
当使用具有 Priority Tier 承诺的模型请求 service_tier="auto" 时,这些响应标头可提供相关信息:
anthropic-priority-input-tokens-limit: 10000
anthropic-priority-input-tokens-remaining: 9618
anthropic-priority-input-tokens-reset: 2025-01-12T23:11:59Z
anthropic-priority-output-tokens-limit: 10000
anthropic-priority-output-tokens-remaining: 6000
anthropic-priority-output-tokens-reset: 2025-01-12T23:12:21Z您可以利用这些标头的存在来检测您的请求是否符合 Priority Tier 的条件,即使它已超出限制。
Priority Tier 承诺包括:
Priority Tier 以 99.5% 的正常运行时间为目标,并提供优先的计算资源。超出您承诺容量的请求会自动回退到标准层级。
Priority Tier 支持所有可用的 Claude 模型,但 Claude Mythos 5、Claude Mythos Preview、Claude Opus 5 和 Claude Sonnet 5 除外。
查看模型概述了解有关可用模型的更多详细信息。
Was this page helpful?