Claude Platform Docs
API-ReferenzSupport & Konfiguration

Service-Tiers

Verschiedene Service-Tiers ermöglichen es dir, Verfügbarkeit, Leistung und vorhersehbare Kosten entsprechend den Anforderungen deiner Anwendung auszubalancieren.

Anthropic bietet drei „service tiers“ (Service-Tiers) an:

  • Priority Tier: Nur für Organisationen mit einer bestehenden Kapazitätszusage verfügbar
  • Standard: Standard-Tier sowohl für Pilotprojekte als auch für die Skalierung alltäglicher Anwendungsfälle
  • Batch: Am besten geeignet für asynchrone Workflows, die warten können oder davon profitieren, außerhalb deiner normalen Kapazität zu laufen

Standardstufe

Der Standard Tier ist der Standard-Service-Tier für alle API-Anfragen. Die API priorisiert diese Anfragen zusammen mit allen anderen Anfragen mit Best-Effort-Verfügbarkeit.

Priority Tier

Die API priorisiert Anfragen in diesem Tier gegenüber allen anderen Anfragen. Diese Priorisierung hilft, „server overloaded“-Fehler zu minimieren, selbst zu Spitzenzeiten.

Weitere Informationen findest du unter Bestehende Priority-Tier-Zusagen.

Wie Anfragen Tiers zugewiesen werden

Bei der Bearbeitung einer Anfrage entscheidet Anthropic in den folgenden Szenarien, eine Anfrage dem Priority Tier zuzuweisen:

  • Deine Organisation verfügt über ausreichend Priority-Tier-Kapazität an Input-Token pro Minute
  • Deine Organisation verfügt über ausreichend Priority-Tier-Kapazität an Output-Token pro Minute

Anthropic rechnet die Nutzung wie folgt auf die Priority-Tier-Kapazität an:

Input-Token

  • Cache-Lesevorgänge mit 0,1 Token pro aus dem Cache gelesenem Token
  • Cache-Schreibvorgänge mit 1,25 Token pro in den Cache geschriebenem Token mit einer TTL von 5 Minuten
  • Cache-Schreibvorgänge mit 2,00 Token pro in den Cache geschriebenem Token mit einer TTL von 1 Stunde
  • Für Anfragen mit US-only-Inferenz (inference_geo: "us") auf Claude 4.6 und neueren Modellen zählen Input-Token mit 1,1 Token pro Token
  • Alle anderen Input-Token zählen mit 1 Token pro Token

Output-Token

  • Für Anfragen mit US-only-Inferenz (inference_geo: "us") auf Claude 4.6 und neueren Modellen zählen Output-Token mit 1,1 Token pro Token
  • Alle anderen Output-Token zählen mit 1 Token pro Token

Andernfalls werden Anfragen im Standard Tier verarbeitet.

Service-Tiers verwenden

Du kannst steuern, welche Service-Tiers für eine Anfrage verwendet werden können, indem du den Parameter service_tier setzt:

client = anthropic.Anthropic()

message = client.messages.create(
    model="claude-opus-4-8",
    max_tokens=1024,
    messages=[{"role": "user", "content": "Hello, Claude!"}],
    service_tier="auto",  # Automatically use Priority Tier when available, fallback to standard
)
print(message.usage.service_tier)

Der Parameter service_tier akzeptiert die folgenden Werte:

  • "auto" (Standard) – Verwendet die Priority-Tier-Kapazität, falls verfügbar, und greift andernfalls auf deine sonstige Kapazität zurück
  • "standard_only" – Verwendet nur Standard-Tier-Kapazität; nützlich, wenn du deine Priority-Tier-Kapazität nicht nutzen möchtest

Das usage-Objekt der Antwort enthält außerdem den der Anfrage zugewiesenen Service-Tier:

{
  "usage": {
    "input_tokens": 410,
    "cache_creation_input_tokens": 0,
    "cache_read_input_tokens": 0,
    "output_tokens": 585,
    "service_tier": "priority"
  }
}

So kannst du feststellen, welcher Service-Tier der Anfrage zugewiesen wurde.

Wenn du service_tier="auto" mit einem Modell mit einer Priority-Tier-Zusage anforderst, liefern diese Antwort-Header Einblicke:

anthropic-priority-input-tokens-limit: 10000
anthropic-priority-input-tokens-remaining: 9618
anthropic-priority-input-tokens-reset: 2025-01-12T23:11:59Z
anthropic-priority-output-tokens-limit: 10000
anthropic-priority-output-tokens-remaining: 6000
anthropic-priority-output-tokens-reset: 2025-01-12T23:12:21Z

Anhand des Vorhandenseins dieser Header kannst du erkennen, ob deine Anfrage für den Priority Tier berechtigt war, selbst wenn sie über dem Limit lag.

Bestehende Priority-Tier-Zusagen

Eine Priority-Tier-Zusage besteht aus:

  • Einer Anzahl von Input-Token pro Minute
  • Einer Anzahl von Output-Token pro Minute
  • Einer Zusagedauer (1, 3, 6 oder 12 Monate)
  • Einer bestimmten Modellversion

Der Priority Tier zielt auf eine Verfügbarkeit von 99,5 % mit priorisierten Rechenressourcen ab. Anfragen, die über deine zugesagte Kapazität hinausgehen, fallen automatisch auf den Standard Tier zurück.

Unterstützte Modelle

Der Priority Tier wird auf allen verfügbaren Claude-Modellen unterstützt, außer Claude Fable 5.1, Claude Mythos 5.1, Claude Mythos 5, Claude Mythos Preview, Claude Opus 5.5, Claude Opus 5, Claude Sonnet 5.5 und Claude Sonnet 5.

Weitere Details zu den verfügbaren Modellen findest du in der Modellübersicht.

Was this page helpful?