服務層級
不同的服務層級讓您能夠根據應用程式的需求,在可用性、效能與可預測的成本之間取得平衡。
Anthropic 提供三種「service tiers」(服務層級):
- Priority Tier(優先層級): 僅提供給已有現行容量承諾的組織
- Standard(標準層級): 預設層級,適用於試行與擴展日常使用情境
- Batch(批次層級): 最適合可以等待、或能從不佔用您一般容量中獲益的非同步工作流程
標準層級
標準層級是所有 API 請求的預設服務層級。API 會以盡力而為的可用性,將這些請求與所有其他請求一同排定優先順序。
Priority Tier
API 會將此層級中的請求優先於所有其他請求處理。這種優先處理有助於將「伺服器過載」錯誤降至最低,即使在尖峰時段也是如此。
如需更多資訊,請參閱現有的 Priority Tier 承諾。
請求如何被分配層級
在處理請求時,Anthropic 會在下列情況下決定將請求分配至 Priority Tier:
- 您的組織擁有足夠的 Priority Tier 容量每分鐘輸入 token
- 您的組織擁有足夠的 Priority Tier 容量每分鐘輸出 token
Anthropic 依下列方式將使用量計入 Priority Tier 容量:
輸入 token
- 快取讀取:每個從快取讀取的 token 計為 0.1 個 token
- 快取寫入:每個以 5 分鐘 TTL 寫入快取的 token 計為 1.25 個 token
- 快取寫入:每個以 1 小時 TTL 寫入快取的 token 計為 2.00 個 token
- 對於在 Claude 4.6 及更新模型上的僅限美國推論(
inference_geo: "us")請求,每個輸入 token 計為 1.1 個 token - 所有其他輸入 token 每個計為 1 個 token
輸出 token
- 對於在 Claude 4.6 及更新模型上的僅限美國推論(
inference_geo: "us")請求,每個輸出 token 計為 1.1 個 token - 所有其他輸出 token 每個計為 1 個 token
否則,請求將以標準層級進行處理。
使用服務層級
您可以透過設定 service_tier 參數來控制請求可使用哪些服務層級:
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-opus-4-8",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello, Claude!"}],
service_tier="auto", # Automatically use Priority Tier when available, fallback to standard
)
print(message.usage.service_tier)service_tier 參數接受下列值:
"auto"(預設)- 若有可用的 Priority Tier 容量則使用之,否則退回使用您的其他容量"standard_only"- 僅使用標準層級容量,若您不想使用 Priority Tier 容量時很有用
回應中的 usage 物件也會包含分配給該請求的服務層級:
{
"usage": {
"input_tokens": 410,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0,
"output_tokens": 585,
"service_tier": "priority"
}
}這讓您能夠判斷該請求被分配到哪個服務層級。
當以 service_tier="auto" 請求具有 Priority Tier 承諾的模型時,下列回應標頭可提供相關資訊:
anthropic-priority-input-tokens-limit: 10000
anthropic-priority-input-tokens-remaining: 9618
anthropic-priority-input-tokens-reset: 2025-01-12T23:11:59Z
anthropic-priority-output-tokens-limit: 10000
anthropic-priority-output-tokens-remaining: 6000
anthropic-priority-output-tokens-reset: 2025-01-12T23:12:21Z您可以透過這些標頭是否存在,來偵測您的請求是否符合 Priority Tier 資格,即使它已超出限制。
現有的 Priority Tier 承諾
一項 Priority Tier 承諾包含:
- 每分鐘輸入 token 數量
- 每分鐘輸出 token 數量
- 承諾期間(1、3、6 或 12 個月)
- 特定的模型版本
Priority Tier 以優先的運算資源為基礎,目標達到 99.5% 的正常運作時間。超出您承諾容量的請求會自動退回至標準層級。
支援的模型
除了 Claude Fable 5.1、Claude Mythos 5.1、Claude Mythos 5、Claude Mythos Preview、Claude Opus 5.5、Claude Opus 5 和 Claude Sonnet 5 之外,所有可用的 Claude 模型皆支援 Priority Tier。
請查看模型概覽以了解可用模型的更多詳細資訊。
Was this page helpful?