Claude Platform Docs
API 參考支援與設定

服務層級

不同的服務層級讓您能夠根據應用程式的需求,在可用性、效能與可預測的成本之間取得平衡。

Anthropic 提供三種「service tiers」(服務層級):

  • Priority Tier(優先層級): 僅提供給已有現行容量承諾的組織
  • Standard(標準層級): 預設層級,適用於試行與擴展日常使用情境
  • Batch(批次層級): 最適合可以等待、或能從不佔用您一般容量中獲益的非同步工作流程

標準層級

標準層級是所有 API 請求的預設服務層級。API 會以盡力而為的可用性,將這些請求與所有其他請求一同排定優先順序。

Priority Tier

API 會將此層級中的請求優先於所有其他請求處理。這種優先處理有助於將「伺服器過載」錯誤降至最低,即使在尖峰時段也是如此。

如需更多資訊,請參閱現有的 Priority Tier 承諾。

請求如何被分配層級

在處理請求時,Anthropic 會在下列情況下決定將請求分配至 Priority Tier:

  • 您的組織擁有足夠的 Priority Tier 容量每分鐘輸入 token
  • 您的組織擁有足夠的 Priority Tier 容量每分鐘輸出 token

Anthropic 依下列方式將使用量計入 Priority Tier 容量:

輸入 token

  • 快取讀取:每個從快取讀取的 token 計為 0.1 個 token
  • 快取寫入:每個以 5 分鐘 TTL 寫入快取的 token 計為 1.25 個 token
  • 快取寫入:每個以 1 小時 TTL 寫入快取的 token 計為 2.00 個 token
  • 對於在 Claude 4.6 及更新模型上的僅限美國推論(inference_geo: "us")請求,每個輸入 token 計為 1.1 個 token
  • 所有其他輸入 token 每個計為 1 個 token

輸出 token

  • 對於在 Claude 4.6 及更新模型上的僅限美國推論(inference_geo: "us")請求,每個輸出 token 計為 1.1 個 token
  • 所有其他輸出 token 每個計為 1 個 token

否則,請求將以標準層級進行處理。

使用服務層級

您可以透過設定 service_tier 參數來控制請求可使用哪些服務層級:

client = anthropic.Anthropic()

message = client.messages.create(
    model="claude-opus-4-8",
    max_tokens=1024,
    messages=[{"role": "user", "content": "Hello, Claude!"}],
    service_tier="auto",  # Automatically use Priority Tier when available, fallback to standard
)
print(message.usage.service_tier)

service_tier 參數接受下列值:

  • "auto"(預設)- 若有可用的 Priority Tier 容量則使用之,否則退回使用您的其他容量
  • "standard_only" - 僅使用標準層級容量,若您不想使用 Priority Tier 容量時很有用

回應中的 usage 物件也會包含分配給該請求的服務層級:

{
  "usage": {
    "input_tokens": 410,
    "cache_creation_input_tokens": 0,
    "cache_read_input_tokens": 0,
    "output_tokens": 585,
    "service_tier": "priority"
  }
}

這讓您能夠判斷該請求被分配到哪個服務層級。

當以 service_tier="auto" 請求具有 Priority Tier 承諾的模型時,下列回應標頭可提供相關資訊:

anthropic-priority-input-tokens-limit: 10000
anthropic-priority-input-tokens-remaining: 9618
anthropic-priority-input-tokens-reset: 2025-01-12T23:11:59Z
anthropic-priority-output-tokens-limit: 10000
anthropic-priority-output-tokens-remaining: 6000
anthropic-priority-output-tokens-reset: 2025-01-12T23:12:21Z

您可以透過這些標頭是否存在,來偵測您的請求是否符合 Priority Tier 資格,即使它已超出限制。

現有的 Priority Tier 承諾

一項 Priority Tier 承諾包含:

  • 每分鐘輸入 token 數量
  • 每分鐘輸出 token 數量
  • 承諾期間(1、3、6 或 12 個月)
  • 特定的模型版本

Priority Tier 以優先的運算資源為基礎,目標達到 99.5% 的正常運作時間。超出您承諾容量的請求會自動退回至標準層級。

支援的模型

除了 Claude Fable 5.1、Claude Mythos 5.1、Claude Mythos 5、Claude Mythos Preview、Claude Opus 5.5、Claude Opus 5 和 Claude Sonnet 5 之外,所有可用的 Claude 模型皆支援 Priority Tier。

請查看模型概覽以了解可用模型的更多詳細資訊。

Was this page helpful?