Fast Mode (Research Preview)
Erhalte bis zu 2,5-mal mehr Output-Token pro Sekunde von unterstützten Claude Opus-Modellen.
Der „Fast mode“ (Schnellmodus) liefert bis zu 2,5-mal mehr Output-Token pro Sekunde von Claude Opus 5.5, Claude Opus 5 und Claude Opus 4.8 zu Premium-Preisen. Setze speed: "fast" zusammen mit dem Beta-Header fast-mode-2026-02-01 in deiner Anfrage, um ihn zu aktivieren.
Unterstützte Modelle
Fast Mode wird auf den folgenden Modellen unterstützt:
- Claude Opus 5.5 ()
- Claude Opus 5 ()
- Claude Opus 4.8 ()
So funktioniert Fast Mode
Fast Mode führt dasselbe Modell mit einer schnelleren Inferenzkonfiguration aus. Es gibt keine Änderung an Intelligenz oder Fähigkeiten.
- Bis zu 2,5-mal mehr Output-Token pro Sekunde im Vergleich zur Standardgeschwindigkeit
- Die Geschwindigkeitsvorteile konzentrieren sich auf „output tokens per second“ (Output-Token pro Sekunde), oder OTPS, nicht auf „time to first token“ (Zeit bis zum ersten Token), oder TTFT
- Dieselben Modellgewichte und dasselbe Verhalten (kein anderes Modell)
- Kompatibel mit Streaming, wo der OTPS-Gewinn am deutlichsten sichtbar ist
Grundlegende Verwendung
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5-5",
max_tokens=4096,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[
{"role": "user", "content": "Refactor this module to use dependency injection"}
],
)
for block in response.content:
if block.type == "text":
print(block.text)Preise
Fast Mode wird mit einem Multiplikator auf die Standardtarife über das gesamte Kontextfenster hinweg berechnet, einschließlich Anfragen mit mehr als 200k Input-Token. Die folgende Tabelle zeigt die Fast-Mode-Preise für die unterstützten Modelle:
| Modell | Input | Output |
|---|---|---|
| Claude Opus 5.5 | 8 $ / MTok | 40 $ / MTok |
| Claude Opus 5 / Claude Opus 4.8 | 10 $ / MTok | 50 $ / MTok |
Die Fast-Mode-Preise werden mit anderen Preismodifikatoren kombiniert:
- Prompt-Caching-Multiplikatoren gelten zusätzlich zu den Fast-Mode-Preisen
- Data-Residency-Multiplikatoren gelten zusätzlich zu den Fast-Mode-Preisen
Vollständige Preisdetails findest du auf der Seite Preise.
Ratenlimits
Fast Mode hat ein eigenes „rate limit“ (Ratenlimit), das von den Standard-Ratenlimits für Opus getrennt ist. Wenn dein Fast-Mode-Ratenlimit überschritten wird, gibt die API einen 429-Fehler mit einem retry-after-Header zurück, der angibt, wann wieder Kapazität verfügbar sein wird.
Die Antwort enthält Header, die den Status deines Fast-Mode-Ratenlimits angeben:
| Header | Beschreibung |
|---|---|
anthropic-fast-input-tokens-limit | Maximale Fast-Mode-Input-Token pro Minute |
anthropic-fast-input-tokens-remaining | Verbleibende Fast-Mode-Input-Token |
anthropic-fast-input-tokens-reset | Zeitpunkt, zu dem das Fast-Mode-Input-Token-Limit zurückgesetzt wird |
anthropic-fast-output-tokens-limit | Maximale Fast-Mode-Output-Token pro Minute |
anthropic-fast-output-tokens-remaining | Verbleibende Fast-Mode-Output-Token |
anthropic-fast-output-tokens-reset | Zeitpunkt, zu dem das Fast-Mode-Output-Token-Limit zurückgesetzt wird |
Stufenspezifische Ratenlimits findest du auf der Seite Ratenlimits.
Prüfen, welche Geschwindigkeit verwendet wurde
Das usage-Objekt der Antwort enthält ein speed-Feld, das angibt, welche Geschwindigkeit verwendet wurde, entweder "fast" oder "standard". Das Anfordern von speed: "fast" auf einem Modell, das Fast Mode nicht unterstützt, gibt einen Fehler zurück, ebenso wie das Überschreiten der Ratenlimits oder der Kapazität des Fast Mode (ein 429 oder 529). Wenn eine Anfrage mit speed: "fast" erfolgreich ist, ist usage.speed gleich "fast". Wenn du Claude Opus 4.6 verwendest und Fast Mode anforderst, ist das Verhalten einzigartig. Anstatt wie andere Modelle, die Fast Mode nicht unterstützen, einen Fehler zurückzugeben, wechselt es stillschweigend zur Standardgeschwindigkeit. Obwohl es bei Opus 4.6 keinen Fehler gibt, zeigt das speed-Feld korrekt "standard" an.
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5-5",
max_tokens=1024,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[{"role": "user", "content": "Hello"}],
)
print(response.usage.speed) # "fast" or "standard"{
"id": "msg_01XFDUDYJgAACzvnptvVoYEL",
"type": "message",
"role": "assistant",
"usage": {
"input_tokens": 8,
"output_tokens": 12,
"speed": "fast"
}
}Um die Fast-Mode-Nutzung und -Kosten in deiner Organisation nachzuverfolgen, siehe die Usage and Cost API.
Wiederholungsversuche und Fallback
Automatische Wiederholungsversuche
Wenn die Fast-Mode-Ratenlimits überschritten werden, gibt die API einen 429-Fehler mit einem retry-after-Header zurück. Die Anthropic SDKs wiederholen diese Anfragen standardmäßig automatisch bis zu 2-mal (konfigurierbar mit max_retries) und warten vor jedem Wiederholungsversuch die vom Server angegebene Verzögerung ab. Da Fast Mode eine kontinuierliche Token-Auffüllung verwendet, ist die retry-after-Verzögerung in der Regel kurz, und Anfragen sind erfolgreich, sobald Kapazität verfügbar ist.
Zurückfallen auf Standardgeschwindigkeit
Wenn du lieber auf die Standardgeschwindigkeit zurückfallen möchtest, anstatt auf Fast-Mode-Kapazität zu warten, fange den Ratenlimit-Fehler ab und wiederhole die Anfrage ohne speed: "fast". Setze max_retries bei der ersten schnellen Anfrage auf 0, um automatische Wiederholungsversuche zu überspringen und bei Ratenlimit-Fehlern sofort fehlzuschlagen.
Da das Setzen von max_retries auf 0 auch Wiederholungsversuche für andere vorübergehende Fehler (Überlastung, interne Serverfehler) deaktiviert, senden die folgenden Beispiele die ursprüngliche Anfrage in diesen Fällen mit den Standard-Wiederholungsversuchen erneut.
client = anthropic.Anthropic()
def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
try:
return client.with_options(max_retries=max_retries).beta.messages.create(
**params
)
except anthropic.RateLimitError:
if params.get("speed") == "fast":
del params["speed"]
return create_message_with_fast_fallback(max_retries=max_retries, **params)
raise
except (
anthropic.APIStatusError,
anthropic.APIConnectionError,
) as error:
if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
raise
if max_attempts > 1:
return create_message_with_fast_fallback(
max_retries=max_retries, max_attempts=max_attempts - 1, **params
)
raise
message = create_message_with_fast_fallback(
model="claude-opus-5-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello"}],
betas=["fast-mode-2026-02-01"],
speed="fast",
max_retries=0,
)Hinweise
- Prompt-Caching: Der Wechsel zwischen schneller und Standardgeschwindigkeit macht den Prompt-Cache ungültig. Anfragen mit unterschiedlichen Geschwindigkeiten teilen keine zwischengespeicherten Präfixe.
- Unterstützte Modelle: Fast Mode wird auf Claude Opus 5.5, Claude Opus 5 und Claude Opus 4.8 unterstützt. Siehe Unterstützte Modelle.
- TTFT: Die Vorteile des Fast Mode konzentrieren sich auf Output-Token pro Sekunde (OTPS), nicht auf die Zeit bis zum ersten Token (TTFT).
- Batch API: Fast Mode ist mit der Batch API nicht verfügbar.
- Priority Tier: Fast Mode ist mit einer Priority Tier-Verpflichtung nicht verfügbar.
- Claude Platform on AWS: Fast Mode ist derzeit nicht auf Claude Platform on AWS verfügbar.
Nächste Schritte
Erhalte validierte JSON-Ergebnisse aus Agenten-Workflows.
Erfahre mehr über die Preisstruktur von Anthropic für Modelle und Funktionen.
Steuere mit dem Effort-Parameter, wie viele Token Claude beim Antworten verwendet, und wäge dabei zwischen Gründlichkeit der Antwort und Token-Effizienz ab.
Streame Antworten der Messages API inkrementell mit Server-Sent Events, einschließlich Text, Tool-Nutzung und Deltas für erweitertes Nachdenken.
Was this page helpful?