Claude Platform Docs
API-ReferenzSupport & Konfiguration

Service-Tiers

Verschiedene Service-Tiers ermöglichen es dir, Verfügbarkeit, Leistung und vorhersehbare Kosten entsprechend den Anforderungen deiner Anwendung auszubalancieren.

Anthropic bietet drei „service tiers“ (Service-Tiers) an:

  • Priority Tier: Nur für Organisationen mit einer bestehenden Kapazitätszusage verfügbar
  • Standard: Standard-Tier sowohl für Pilotprojekte als auch für die Skalierung alltäglicher Anwendungsfälle
  • Batch: Am besten geeignet für asynchrone Workflows, die warten können oder davon profitieren, außerhalb deiner normalen Kapazität zu laufen

Standard Tier

Der Standard Tier ist der Standard-Service-Tier für alle API-Anfragen. Die API priorisiert diese Anfragen zusammen mit allen anderen Anfragen mit Best-Effort-Verfügbarkeit.

Priority Tier

Die API priorisiert Anfragen in diesem Tier gegenüber allen anderen Anfragen. Diese Priorisierung hilft, „server overloaded“-Fehler zu minimieren, selbst zu Spitzenzeiten.

Weitere Informationen findest du unter Bestehende Priority-Tier-Zusagen.

Wie Anfragen Tiers zugewiesen werden

Bei der Bearbeitung einer Anfrage entscheidet Anthropic in den folgenden Szenarien, eine Anfrage dem Priority Tier zuzuweisen:

  • Deine Organisation verfügt über ausreichend Priority-Tier-Kapazität an Input-Token pro Minute
  • Deine Organisation verfügt über ausreichend Priority-Tier-Kapazität an Output-Token pro Minute

Anthropic rechnet die Nutzung wie folgt auf die Priority-Tier-Kapazität an:

Input-Token

  • Cache-Lesevorgänge mit 0,1 Token pro aus dem Cache gelesenem Token
  • Cache-Schreibvorgänge mit 1,25 Token pro in den Cache geschriebenem Token mit einer TTL von 5 Minuten
  • Cache-Schreibvorgänge mit 2,00 Token pro in den Cache geschriebenem Token mit einer TTL von 1 Stunde
  • Für Anfragen mit US-only-Inferenz (inference_geo: "us") auf Claude 4.6 und neueren Modellen zählen Input-Token mit 1,1 Token pro Token
  • Alle anderen Input-Token zählen mit 1 Token pro Token

Output-Token

  • Für Anfragen mit US-only-Inferenz (inference_geo: "us") auf Claude 4.6 und neueren Modellen zählen Output-Token mit 1,1 Token pro Token
  • Alle anderen Output-Token zählen mit 1 Token pro Token

Andernfalls werden Anfragen im Standard Tier verarbeitet.

Service-Tiers verwenden

Du kannst steuern, welche Service-Tiers für eine Anfrage verwendet werden können, indem du den Parameter service_tier setzt:

client = anthropic.Anthropic()

message = client.messages.create(
    model="claude-opus-4-8",
    max_tokens=1024,
    messages=[{"role": "user", "content": "Hello, Claude!"}],
    service_tier="auto",  # Automatically use Priority Tier when available, fallback to standard
)
print(message.usage.service_tier)

Der Parameter service_tier akzeptiert die folgenden Werte:

  • "auto" (Standard) – Verwendet die Priority-Tier-Kapazität, falls verfügbar, und greift andernfalls auf deine sonstige Kapazität zurück
  • "standard_only" – Verwendet nur Standard-Tier-Kapazität; nützlich, wenn du deine Priority-Tier-Kapazität nicht nutzen möchtest

Das usage-Objekt der Antwort enthält außerdem den der Anfrage zugewiesenen Service-Tier:

{
  "usage": {
    "input_tokens": 410,
    "cache_creation_input_tokens": 0,
    "cache_read_input_tokens": 0,
    "output_tokens": 585,
    "service_tier": "priority"
  }
}

So kannst du feststellen, welcher Service-Tier der Anfrage zugewiesen wurde.

Wenn du service_tier="auto" mit einem Modell mit einer Priority-Tier-Zusage anforderst, liefern diese Antwort-Header Einblicke:

anthropic-priority-input-tokens-limit: 10000
anthropic-priority-input-tokens-remaining: 9618
anthropic-priority-input-tokens-reset: 2025-01-12T23:11:59Z
anthropic-priority-output-tokens-limit: 10000
anthropic-priority-output-tokens-remaining: 6000
anthropic-priority-output-tokens-reset: 2025-01-12T23:12:21Z

Anhand des Vorhandenseins dieser Header kannst du erkennen, ob deine Anfrage für den Priority Tier berechtigt war, selbst wenn sie über dem Limit lag.

Bestehende Priority-Tier-Zusagen

Eine Priority-Tier-Zusage besteht aus:

  • Einer Anzahl von Input-Token pro Minute
  • Einer Anzahl von Output-Token pro Minute
  • Einer Zusagedauer (1, 3, 6 oder 12 Monate)
  • Einer bestimmten Modellversion

Der Priority Tier zielt auf eine Verfügbarkeit von 99,5 % mit priorisierten Rechenressourcen ab. Anfragen, die über deine zugesagte Kapazität hinausgehen, fallen automatisch auf den Standard Tier zurück.

Unterstützte Modelle

Der Priority Tier wird auf allen verfügbaren Claude-Modellen unterstützt, mit Ausnahme von Claude Fable 5.1, Claude Mythos 5.1, Claude Mythos 5, Claude Mythos Preview, Claude Opus 5 und Claude Sonnet 5.

Weitere Details zu den verfügbaren Modellen findest du in der Modellübersicht.

Was this page helpful?