Claude Opus 5 ist eine sprunghafte Verbesserung gegenüber Claude Opus 4.8, mit den größten Fortschritten bei tiefem Reasoning, agentischen und langfristigen Aufgaben sowie der Skalierung von Test-Time-Compute. Diese Seite fasst alles Neue in Claude Opus 5 zusammen, einschließlich standardmäßig aktiviertem Thinking, Tool-Änderungen mitten in der Konversation und einer Breaking Change dazu, wann Thinking deaktiviert werden kann.
| Modell | API-Modell-ID | Beschreibung |
|---|---|---|
| Claude Opus 5 | claude-opus-5 | Für komplexes agentisches Coding und Enterprise-Arbeit |
Claude Opus 5 hat ein 1M-Token-Kontextfenster (1M Token ist sowohl der Standard als auch das Maximum; es gibt keine kleinere Kontextvariante), 128k maximale Output-Token und Thinking standardmäßig aktiviert.
Vollständige Preise und Spezifikationen findest du in der Modellübersicht.
Du kannst Tools zwischen den Turns einer Konversation hinzufügen oder entfernen und dabei den Prompt-Cache erhalten, anstatt für die gesamte Dauer einer Session eine feste Tool-Liste erneut zu senden. Tool-Änderungen mitten in der Konversation befinden sich in der Beta: Füge den Beta-Header mid-conversation-tool-changes-2026-07-01 in deine Requests ein. Siehe Tool-Änderungen mitten in der Konversation für die Verwendung.
Der fallbacks-Parameter unterstützt einen neuen "default"-Modus, der Anthropics empfohlene Fallback-Modelle nach Refusal-Kategorie anwendet, anstatt einer Modellliste, die du selbst pflegst. Der gesamte fallbacks-Parameter befindet sich in der Beta. Verwende den Beta-Header server-side-fallback-2026-07-01, der sowohl den "default"-Modus als auch explizite Modelllisten unterstützt (der frühere Header server-side-fallback-2026-06-01 akzeptiert nur explizite Listen). Siehe Refusals und Fallback.
Die minimale cachebare Prompt-Länge auf Claude Opus 5 beträgt 512 Token, gegenüber 1.024 Token auf Claude Opus 4.8. Prompts, die auf Claude Opus 4.8 zu kurz zum Cachen waren, können jetzt ohne Code-Änderungen Cache-Einträge erstellen. Siehe Prompt-Caching für die Minima pro Modell.
Fast Mode (Research Preview) ist für Claude Opus 5 nur über die Claude API verfügbar; er ist derzeit nicht auf Amazon Bedrock, Google Cloud oder Microsoft Foundry verfügbar. Fast Mode für Claude Opus 5 kostet 10 $ pro Million Input-Token und 50 $ pro Million Output-Token. Siehe Fast Mode für Zugang, unterstützte Modelle und Preise.
Auf Claude Opus 4.8 laufen Requests ohne Thinking, es sei denn, du setzt thinking: {"type": "adaptive"}. Auf Claude Opus 5 laufen dieselben Requests mit aktiviertem Thinking: Das Modell entscheidet bei jedem Turn, wann und wie viel es denkt, und der Effort-Parameter ist die Steuerung für die Denktiefe. Der Wire-Wert ist unverändert; thinking: {"type": "adaptive"} bleibt gültig und ist äquivalent zum Standard.
Da max_tokens ein hartes Limit für den gesamten Output ist (Thinking plus Antworttext), solltest du es für Workloads überprüfen, die auf Claude Opus 4.8 ohne Thinking liefen.
Die API behält die Option, Thinking zu deaktivieren, vorbehaltlich der unten beschriebenen Effort-Einschränkung.
Claude Opus 5 wandelt zusätzlichen Effort zuverlässiger in bessere Ergebnisse um als jedes frühere Opus-Modell, daher hat das von dir gewählte Effort-Level mehr Gewicht. Die vollständige Skala ist verfügbar: low, medium, high, xhigh und max, wobei max die oberste Stufe für das tiefstmögliche Reasoning ist. Beginne mit dem Standard high und passe basierend auf deinen Evals in beide Richtungen an: Gehe nach unten, wo die Qualität gehalten wird, um Token und Latenz zu sparen, oder nach oben für die anspruchsvollste Arbeit. Wenn du mit xhigh- oder max-Effort arbeitest, setze ein großes max_tokens, damit das Modell Raum hat, über Subagenten und Tool-Aufrufe hinweg zu denken und zu handeln.
Dieser Request dreht den Effort ganz auf max hoch:
client = anthropic.Anthropic()
with client.messages.stream(
model="claude-opus-5",
max_tokens=64000,
output_config={"effort": "max"},
messages=[
{
"role": "user",
"content": "Explain why the sum of two even numbers is always even.",
}
],
) as stream:
response = stream.get_final_message()
print(response)Thinking ist auf Claude Opus 5 standardmäßig aktiviert, daher ist kein thinking-Feld erforderlich.
high oder niedrigerAuf Claude Opus 5 wird thinking: {"type": "disabled"} nur akzeptiert, wenn das Effort-Level high oder niedriger ist. Das Setzen von thinking: {"type": "disabled"} mit Effort xhigh oder max gibt einen 400-Fehler zurück. Dies ist ab Claude Opus 5 allgemein verfügbares Verhalten, das bei jedem Request durchgesetzt wird, und es ist eine Breaking Change gegenüber Claude Opus 4.8, wo das Deaktivieren von Thinking unabhängig vom Effort-Level war. Wenn du heute Thinking bei hohen Effort-Levels deaktivierst, behalte entweder Thinking deaktiviert und setze Effort auf high oder niedriger, oder behalte das Effort-Level und entferne das thinking-Feld.
Mit deaktiviertem Thinking kann Claude Opus 5 gelegentlich einen Tool-Aufruf in seinen Text-Output schreiben, anstatt einen tool_use-Block auszugeben, oder interne XML-Tags in seine sichtbare Antwort aufnehmen. Wo möglich, lasse Thinking aktiviert und steuere die Token-Kosten mit niedrigeren Effort-Levels; für Integrationen, die Thinking deaktiviert lassen müssen, siehe Ausführen mit deaktiviertem Thinking für Prompting-Gegenmaßnahmen.
Über die oben genannten API-Änderungen hinaus verhält sich Claude Opus 5 anders als Claude Opus 4.8, und zwar auf eine Weise, die dir auffallen kann, ohne dass du Code änderst. Standardmäßige nutzerseitige Antworten und schriftliche Ergebnisse fallen länger aus. In agentischen Sessions berichtet das Modell dem Nutzer häufiger über seinen Fortschritt. In Multi-Agent-Frameworks delegiert es bereitwilliger an Subagenten. Es verifiziert außerdem seine eigene Arbeit, ohne dazu aufgefordert zu werden; entferne daher Verifizierungsanweisungen, die von früheren Modellen übernommen wurden („füge einen abschließenden Verifizierungsschritt hinzu", „verwende einen Subagenten zur Verifizierung"); sie verursachen auf Claude Opus 5 eine Über-Verifizierung. Für Prompting-Muster, die jedes dieser Verhaltensweisen abstimmen, siehe Prompting für Claude Opus 5.
Im Vergleich zu Claude Opus 4.8 ist Claude Opus 5 eine sprunghafte Verbesserung statt einer inkrementellen, und es liefert Frontier-Intelligenz zur Hälfte der Kosten von Claude Fable 5. Die größten Fortschritte liegen in:
max-Level) in bessere Ergebnisse umgewandelt wird.low- und medium-Effort starke Qualität bei einem Bruchteil der Token und Latenz höherer Einstellungen liefern.Für die Prompting-Muster, die das Beste aus diesen Fähigkeiten herausholen, siehe Prompting für Claude Opus 5.
Claude Opus 5 kostet 5 $ pro Million Input-Token und 25 $ pro Million Output-Token, unverändert gegenüber Claude Opus 4.8.
Siehe Preise für vollständige Preise, einschließlich Batch-Verarbeitung, Prompt-Caching und Fast-Mode-Tarifen.
Claude Opus 5 ist verfügbar auf:
claude-opus-5.anthropic.claude-opus-5. Claude Opus 5 ist auch über die InvokeModel-API auf bedrock-runtime erreichbar, die von derselben Infrastruktur bedient wird; die Integration Claude on Amazon Bedrock (Legacy) führt es nicht in ihrer ARN-versionierten Modell-ID-Tabelle auf.claude-opus-5.Claude Opus 4.8 bleibt auf all diesen Plattformen verfügbar.
Um von Claude Opus 4.8 zu migrieren, aktualisiere deine Modell-ID:
model = "claude-opus-4-8" # Before
model = "claude-opus-5" # AfterÜberprüfe dann die beiden Verhaltensänderungen: Thinking ist standardmäßig aktiviert, und das Deaktivieren von Thinking mit Effort xhigh oder max gibt einen 400-Fehler zurück. Siehe den Migrationsleitfaden für eine Schritt-für-Schritt-Anleitung.
Vollständige Spezifikationen und Preise für alle aktuellen Claude-Modelle.
Verhaltensunterschiede und Prompting-Muster speziell für Claude Opus 5.
Steuere, wie viele Token Claude beim Antworten verwendet, von low bis max.
Wie Thinking funktioniert, wenn es standardmäßig aktiviert ist, und wann es deaktiviert werden kann.
Gib Claude ein beratendes Token-Budget, an dem es seine Arbeit ausrichten kann.
Leitfaden für die Migration von früheren Claude-Versionen zu den neuesten Claude-Modellen.
Erhalte mehr Output-Token pro Sekunde von Claude Opus-Modellen zu Premium-Preisen.
Was this page helpful?