Service-Tiers
Verschiedene Service-Tiers ermöglichen es dir, Verfügbarkeit, Leistung und vorhersehbare Kosten entsprechend den Anforderungen deiner Anwendung auszubalancieren.
Anthropic bietet drei „service tiers“ (Service-Tiers) an:
- Priority Tier: Nur für Organisationen mit einer bestehenden Kapazitätszusage verfügbar
- Standard: Standard-Tier sowohl für Pilotprojekte als auch für die Skalierung alltäglicher Anwendungsfälle
- Batch: Am besten geeignet für asynchrone Workflows, die warten können oder davon profitieren, außerhalb deiner normalen Kapazität zu laufen
Standard Tier
Der Standard Tier ist der Standard-Service-Tier für alle API-Anfragen. Die API priorisiert diese Anfragen zusammen mit allen anderen Anfragen mit Best-Effort-Verfügbarkeit.
Priority Tier
Die API priorisiert Anfragen in diesem Tier gegenüber allen anderen Anfragen. Diese Priorisierung hilft, „server overloaded“-Fehler zu minimieren, selbst zu Spitzenzeiten.
Weitere Informationen findest du unter Bestehende Priority-Tier-Zusagen.
Wie Anfragen Tiers zugewiesen werden
Bei der Bearbeitung einer Anfrage entscheidet Anthropic in den folgenden Szenarien, eine Anfrage dem Priority Tier zuzuweisen:
- Deine Organisation verfügt über ausreichend Priority-Tier-Kapazität an Input-Token pro Minute
- Deine Organisation verfügt über ausreichend Priority-Tier-Kapazität an Output-Token pro Minute
Anthropic rechnet die Nutzung wie folgt auf die Priority-Tier-Kapazität an:
Input-Token
- Cache-Lesevorgänge mit 0,1 Token pro aus dem Cache gelesenem Token
- Cache-Schreibvorgänge mit 1,25 Token pro in den Cache geschriebenem Token mit einer TTL von 5 Minuten
- Cache-Schreibvorgänge mit 2,00 Token pro in den Cache geschriebenem Token mit einer TTL von 1 Stunde
- Für Anfragen mit US-only-Inferenz (
inference_geo: "us") auf Claude 4.6 und neueren Modellen zählen Input-Token mit 1,1 Token pro Token - Alle anderen Input-Token zählen mit 1 Token pro Token
Output-Token
- Für Anfragen mit US-only-Inferenz (
inference_geo: "us") auf Claude 4.6 und neueren Modellen zählen Output-Token mit 1,1 Token pro Token - Alle anderen Output-Token zählen mit 1 Token pro Token
Andernfalls werden Anfragen im Standard Tier verarbeitet.
Service-Tiers verwenden
Du kannst steuern, welche Service-Tiers für eine Anfrage verwendet werden können, indem du den Parameter service_tier setzt:
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-opus-4-8",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello, Claude!"}],
service_tier="auto", # Automatically use Priority Tier when available, fallback to standard
)
print(message.usage.service_tier)Der Parameter service_tier akzeptiert die folgenden Werte:
"auto"(Standard) – Verwendet die Priority-Tier-Kapazität, falls verfügbar, und greift andernfalls auf deine sonstige Kapazität zurück"standard_only"– Verwendet nur Standard-Tier-Kapazität; nützlich, wenn du deine Priority-Tier-Kapazität nicht nutzen möchtest
Das usage-Objekt der Antwort enthält außerdem den der Anfrage zugewiesenen Service-Tier:
{
"usage": {
"input_tokens": 410,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0,
"output_tokens": 585,
"service_tier": "priority"
}
}So kannst du feststellen, welcher Service-Tier der Anfrage zugewiesen wurde.
Wenn du service_tier="auto" mit einem Modell mit einer Priority-Tier-Zusage anforderst, liefern diese Antwort-Header Einblicke:
anthropic-priority-input-tokens-limit: 10000
anthropic-priority-input-tokens-remaining: 9618
anthropic-priority-input-tokens-reset: 2025-01-12T23:11:59Z
anthropic-priority-output-tokens-limit: 10000
anthropic-priority-output-tokens-remaining: 6000
anthropic-priority-output-tokens-reset: 2025-01-12T23:12:21ZAnhand des Vorhandenseins dieser Header kannst du erkennen, ob deine Anfrage für den Priority Tier berechtigt war, selbst wenn sie über dem Limit lag.
Bestehende Priority-Tier-Zusagen
Eine Priority-Tier-Zusage besteht aus:
- Einer Anzahl von Input-Token pro Minute
- Einer Anzahl von Output-Token pro Minute
- Einer Zusagedauer (1, 3, 6 oder 12 Monate)
- Einer bestimmten Modellversion
Der Priority Tier zielt auf eine Verfügbarkeit von 99,5 % mit priorisierten Rechenressourcen ab. Anfragen, die über deine zugesagte Kapazität hinausgehen, fallen automatisch auf den Standard Tier zurück.
Unterstützte Modelle
Der Priority Tier wird auf allen verfügbaren Claude-Modellen unterstützt, mit Ausnahme von Claude Fable 5.1, Claude Mythos 5.1, Claude Mythos 5, Claude Mythos Preview, Claude Opus 5 und Claude Sonnet 5.
Weitere Details zu den verfügbaren Modellen findest du in der Modellübersicht.
Was this page helpful?