Claude Platform Docs
Modelle & PreiseClaude Opus 5

Migration zu Claude Opus 5

Migriere von früheren Claude-Modellen zu Claude Opus 5: Modell-IDs, Breaking Changes, empfohlene Änderungen und Migrations-Checklisten.

Claude Opus 5 ist eine sprunghafte Verbesserung gegenüber Claude Opus 4.8, stark bei tiefgehendem Schlussfolgern, agentischen Aufgaben und Aufgaben mit langem Zeithorizont sowie bei „test-time compute scaling“ (Skalierung der Rechenleistung zur Inferenzzeit). Zu Verhaltensunterschieden und modellspezifischen Prompting-Mustern siehe Prompting für Claude Opus 5.

Claude Opus 5 ist ein Drop-in-Upgrade für Claude Opus 4.8 zum gleichen Preis von 5 $ pro Million Input-Token und 25 $ pro Million Output-Token; siehe Claude-Preise. Es gibt zwei „breaking changes“ (nicht abwärtskompatible Änderungen) für Code, der bereits auf Claude Opus 4.8 läuft; sie werden unter Breaking Changes behandelt. Claude Opus 5 unterstützt denselben Funktionsumfang wie Claude Opus 4.8, einschließlich des „context window“ (Kontextfensters) mit 1 Mio. Token (der Standard, ohne Beta-Header), 128k maximaler Output-Token, „adaptive thinking“ (adaptives Denken), „prompt caching“ (Prompt-Caching), „batch processing“ (Batch-Verarbeitung), der Files API, PDF-Unterstützung, „vision“ (Bildverarbeitung) sowie serverseitiger und clientseitiger Tools, mit zwei Ausnahmen: „web fetch“ (Web-Abruf) ist auf Claude Opus 5 nicht verfügbar, und Priority Tier wird auf Claude Opus 5 nicht unterstützt. Die Modellverfügbarkeit findest du auf der jeweiligen Tool-Seite.

Migration zu Claude Opus 5 von Claude Opus 4.8

Aktualisiere deinen Modellnamen

# Opus-Migration
model = "claude-opus-4-8"  # Before
model = "claude-opus-5"  # After

claude-opus-5 ist eine feste Modell-ID ohne Datumssuffix, nach demselben Schema wie claude-opus-4-8 und claude-sonnet-5.

Breaking Changes

  1. Denken standardmäßig aktiviert: Auf Claude Opus 4.8 laufen Anfragen ohne thinking-Feld ohne Denken; auf Claude Opus 5 laufen dieselben Anfragen mit adaptivem Denken. max_tokens bleibt eine harte Obergrenze für die gesamte Ausgabe, Denken plus Antworttext, also überprüfe den Wert für Workloads, die auf Claude Opus 4.8 ohne Denken liefen. Thinking-Token werden als Output-Token abgerechnet, auch wenn der Denktext nicht an dich zurückgegeben wird. Obwohl der Preis pro Token unverändert ist, kann ein Workload, der auf Claude Opus 4.8 ohne Denken lief, auf Claude Opus 5 daher mehr Output-Token pro Anfrage erzeugen; siehe Kostenkontrolle. Um das alte Verhalten beizubehalten, übergib thinking: {type: "disabled"}, vorbehaltlich der Effort-Obergrenze im nächsten Punkt. Beachte, dass das Modell bei deaktiviertem Denken gelegentlich Tool-Aufrufe als Klartext ausgeben oder interne XML-Tags in seine sichtbare Ausgabe aufnehmen kann. Bevorzuge daher, wo möglich, niedrigere Effort-Stufen mit aktiviertem Denken, und siehe Betrieb mit deaktiviertem Denken für Gegenmaßnahmen, wo das nicht möglich ist.

    Die Form der Antwort ändert sich damit ebenfalls. Bei aktiviertem Denken kann eine Antwort mit einem oder mehreren thinking-Blöcken vor dem ersten text-Block beginnen, und da thinking.display auf Claude Opus 5 standardmäßig "omitted" ist, kommen diese Blöcke mit einem leeren thinking-Feld neben ihrer signature an. Code, der die Antwort nach Position liest, etwa content[0].text oder ein Stream-Handler, der das erste content_block_start-Event als Text behandelt, bricht bei diesen Antworten. Wähle Content-Blöcke stattdessen anhand ihres type-Felds aus: Lies text aus den Blöcken, deren type "text" ist, und verzweige bei der Verarbeitung von Stream-Events nach dem Blocktyp. Um lesbare Denkzusammenfassungen statt eines leeren thinking-Felds zu erhalten, setze display: "summarized"; siehe Steuerung der Thinking-Anzeige.

    Wenn du eine Tool-Use-Schleife („tool use“, Tool-Nutzung) betreibst, gib die thinking-Blöcke aus jeder Assistant-Antwort vollständig und unverändert an die API zurück, wenn du Tool-Ergebnisse zurückgibst, einschließlich der Blöcke, deren thinking-Feld leer ist. Gib die Assistant-Nachricht so zurück, wie du sie erhalten hast, anstatt ihre Content-Blöcke nach Typ zu filtern oder sie neu aufzubauen: Die API lehnt bearbeitete, umsortierte oder teilweise entfernte Thinking-Blöcke mit einem 400-Fehler ab. Siehe Thinking-Blöcke beibehalten.

  2. Das Deaktivieren des Denkens ist auf Effort high begrenzt: Du kannst das Denken weiterhin mit thinking: {type: "disabled"} ausschalten, aber nur auf einer „effort“-Stufe (Aufwandsstufe) von high oder darunter. Eine Anfrage, die thinking: {type: "disabled"} mit Effort xhigh oder max kombiniert, gibt einen 400-Fehler zurück. Claude Opus 4.8 akzeptiert diese Kombination, also prüfe Anfragen, die das Denken deaktivieren, bevor du migrierst.

    Die Prüfung wird bei jeder Anfrage durchgesetzt: Die Effort- und Thinking-Konfiguration jeder Anfrage wird unabhängig validiert, sodass eine Anfrage, die den Effort bei deaktiviertem Denken auf xhigh oder max anhebt, abgelehnt wird, selbst wenn frühere Anfragen in der Konversation akzeptiert wurden.

    Vorher (auf Claude Opus 4.8 akzeptiert, auf Claude Opus 5 abgelehnt):

    client.messages.create(
        model="claude-opus-4-8",
        max_tokens=16000,
        thinking={"type": "disabled"},
        output_config={"effort": "xhigh"},
        messages=[{"role": "user", "content": "..."}],
    )

    Nachher (Claude Opus 5): Entferne entweder das thinking-Feld, um das Denken wieder zu aktivieren:

    client.messages.create(
        model="claude-opus-5",
        max_tokens=16000,
        output_config={"effort": "xhigh"},  # thinking is on by default
        messages=[{"role": "user", "content": "..."}],
    )

    oder lass das Denken deaktiviert und senke den Effort:

    client.messages.create(
        model="claude-opus-5",
        max_tokens=16000,
        thinking={"type": "disabled"},
        output_config={"effort": "high"},  # or "medium", "low"
        messages=[{"role": "user", "content": "..."}],
    )

Diese sind nicht erforderlich, verbessern aber deine Erfahrung:

  1. Teste Effort max für fähigkeitskritische Arbeit: Claude Opus 5 unterstützt den vollständigen Satz an Effort-Stufen (low, medium, high, xhigh, max). Wo maximale Leistungsfähigkeit wichtiger ist als Token-Verbrauch, teste Effort max. Es kann bei den anspruchsvollsten Aufgaben Zugewinne bringen, zeigt aber möglicherweise abnehmende Erträge durch erhöhten Token-Verbrauch und kann bei einfacheren Aufgaben zu Overthinking neigen. Wenn du mit Effort xhigh oder max arbeitest, setze ein großes max_tokens, damit das Modell Raum zum Denken und Handeln hat; beginne bei 64k Token und justiere von dort aus.

  2. Erwäge automatische Fallbacks: Claude Opus 5 wird mit Cybersecurity-Sicherheitsklassifikatoren ausgeliefert, deren Ablehnungen in der Cyber-Kategorie auf Claude Opus 4.8 zurückfallen können. Um abgelehnte Anfragen automatisch auf einem anderen Modell erneut auszuführen, erwäge den Parameter fallbacks mit dem Modus "default" (fallbacks: "default"), der anhand der Ablehnungskategorie ein empfohlenes Fallback-Modell auswählt, statt einer manuell gepflegten Modellliste. Serverseitiges Fallback ist in der Beta; der Modus "default" erfordert den Beta-Header server-side-fallback-2026-07-01. Siehe Ablehnungen und Fallback.

  3. Cache kürzere Prompts: Die minimale cachebare Prompt-Länge auf Claude Opus 5 beträgt 512 Token, gegenüber 1.024 Token auf Claude Opus 4.8. Prompts, die auf Claude Opus 4.8 zu kurz zum Cachen waren, können jetzt Cache-Einträge erzeugen, ohne dass Codeänderungen erforderlich sind. Siehe Prompt-Caching für die Mindestwerte pro Modell.

  4. Ändere Tools mitten in der Konversation (Beta): Du kannst zwischen den Turns einer Konversation Tools hinzufügen oder entfernen, ohne Prompt-Cache-Treffer auf früheren Turns ungültig zu machen. Sende den Beta-Header mid-conversation-tool-changes-2026-07-01. Das ist nützlich für agentische Workloads, die Tools schrittweise freigeben oder sie im Verlauf einer Aufgabe zurückziehen; ohne ihn macht eine geänderte Tool-Liste das gecachte Präfix ungültig.

  5. Stimme Prompts zu Länge und Ausführlichkeit neu ab: Standardmäßige sichtbare Antworten und schriftliche Arbeitsergebnisse fallen auf Claude Opus 5 länger aus als auf Claude Opus 4.8, und ein niedrigerer Effort reduziert das Denkvolumen, ohne die sichtbare Antwort zuverlässig zu verkürzen. Fordere stattdessen explizit Prägnanz oder eine Ziellänge an. Siehe Antwortlänge und Ausführlichkeit und Länge schriftlicher Arbeitsergebnisse.

  6. Entferne übernommene Verifizierungsanweisungen und begrenze den Umfang: Claude Opus 5 überprüft seine eigene Arbeit, ohne dazu aufgefordert zu werden. Entferne daher explizite Verifizierungs- oder Selbstprüfungsanweisungen, die aus für frühere Modelle abgestimmten Prompts übernommen wurden; sie beizubehalten führt zu Überverifizierung. Begrenze bei eng gefassten Aufgaben den Aufgabenumfang explizit. Gib in Multi-Agenten-Frameworks explizite Hinweise, welche Szenarien eine Delegation rechtfertigen, oder begrenze die Anzahl der Subagenten, da Claude Opus 5 bereitwilliger delegiert als frühere Modelle. Siehe Aufgabenumfang und Überverifizierung und Steuerung des Startens von Subagenten.

Migrations-Checkliste

  • Aktualisiere den Modellnamen von claude-opus-4-8 auf claude-opus-5.
  • Überprüfe Workloads, die ohne thinking-Feld liefen: Sie laufen auf Claude Opus 5 mit Denken. Überprüfe max_tokens, das eine harte Obergrenze für die gesamte Ausgabe (Denken plus Antworttext) bleibt, oder übergib thinking: {type: "disabled"} bei Effort high oder darunter, um das alte Verhalten beizubehalten. Wenn du das Denken deaktivierst, lies Betrieb mit deaktiviertem Denken zu den Ausgabeartefakten, die auftreten können, und den entsprechenden Prompting-Gegenmaßnahmen.
  • Aktualisiere Antwort-Parsing, das Inhalte nach Position liest, etwa content[0].text oder einen Stream-Handler, der annimmt, dass der erste Content-Block Text ist: Bei aktiviertem Denken kommen thinking-Blöcke vor text-Blöcken an. Wähle Content-Blöcke stattdessen nach type aus.
  • Wenn du eine Tool-Use-Schleife betreibst, gib thinking-Blöcke vollständig und unverändert zurück, wenn du Tool-Ergebnisse zurückgibst; veränderte Blöcke führen zu einem 400-Fehler. Siehe Thinking-Blöcke beibehalten.
  • Stelle sicher, dass jeder Code, der das thinking-Feld parst, es nur als Anzeigetext behandelt. thinking.display ist auf Claude Opus 5 standardmäßig "omitted", genau wie auf Claude Opus 4.8, sodass Thinking-Blöcke mit einem leeren thinking-Feld ankommen; setze display: "summarized", um lesbare Zusammenfassungen zu erhalten. Siehe Steuerung der Thinking-Anzeige.
  • Prüfe Anfragen, die das Denken deaktivieren: thinking: {type: "disabled"} mit Effort xhigh oder max gibt einen 400-Fehler zurück, durchgesetzt bei jeder Anfrage. Aktiviere das Denken wieder oder senke den Effort auf high oder darunter.
  • Bewerte deine effort-Einstellung neu: Führe einen frischen Effort-Sweep auf deinen eigenen Evals durch, statt eine für ein früheres Modell abgestimmte Einstellung zu übernehmen. Effort low und medium sind als Kosten- und Latenzsteuerung einen Test wert, und teste Effort max, wo maximale Leistungsfähigkeit wichtiger ist als Token-Verbrauch. Wenn du mit Effort xhigh oder max arbeitest, erhöhe max_tokens als Ausgangspunkt auf mindestens 64k.
  • Überprüfe Prompts nahe dem Caching-Minimum: Prompts mit 512 Token oder mehr können jetzt Cache-Einträge erzeugen, gegenüber 1.024 Token auf Claude Opus 4.8.
  • Behandle stop_reason: "refusal" und erwäge fallbacks: "default" (Beta), um abgelehnte Anfragen automatisch auf einem empfohlenen Fallback-Modell erneut auszuführen.
  • Wenn deine Organisation eine Priority Tier-Zusage hat, plane die Kapazität separat: Priority Tier wird auf Claude Opus 5 nicht unterstützt, während Claude Opus 4.8 es behält.
  • Erwäge für agentische Workloads „task budgets“ (Aufgabenbudgets) (Beta) und Tool-Änderungen mitten in der Konversation (Beta).
  • Stimme Prompts zu Länge und Ausführlichkeit neu ab: Standardmäßige sichtbare Antworten und schriftliche Arbeitsergebnisse fallen auf Claude Opus 5 länger aus, und ein niedrigerer Effort reduziert das Denkvolumen, ohne die sichtbare Antwort zuverlässig zu verkürzen. Fordere explizit Prägnanz oder eine Ziellänge an. Siehe Antwortlänge und Ausführlichkeit und Länge schriftlicher Arbeitsergebnisse.
  • Entferne Verifizierungs- und Selbstprüfungsanweisungen, die aus für frühere Modelle abgestimmten Prompts übernommen wurden (sie verursachen auf Claude Opus 5 Überverifizierung), begrenze den Aufgabenumfang bei eng gefassten Aufgaben explizit und steuere oder begrenze in Multi-Agenten-Frameworks die Delegation an Subagenten. Siehe Aufgabenumfang und Überverifizierung und Steuerung des Startens von Subagenten.
  • Ermittle Kosten und Latenz auf deinen eigenen Workloads neu. Der Preis pro Token ist gegenüber Claude Opus 4.8 unverändert, aber Thinking-Token werden als Output-Token abgerechnet, sodass Workloads, die ohne Denken liefen, mehr Output-Token pro Anfrage erzeugen können.

Migration zu Claude Opus 5 von Claude Opus 4.7

Claude Opus 5 sollte auf bestehenden Prompts und Evals für Claude Opus 4.7 eine starke Out-of-the-box-Leistung zeigen, zum gleichen Preis von 5 $ pro Million Input-Token und 25 $ pro Million Output-Token. Es unterstützt denselben Funktionsumfang wie Claude Opus 4.7, einschließlich des Kontextfensters mit 1 Mio. Token, 128k maximaler Output-Token, adaptiven Denkens, Prompt-Caching, Batch-Verarbeitung, der Files API, PDF-Unterstützung, Bildverarbeitung sowie serverseitiger und clientseitiger Tools, mit zwei Ausnahmen: Web Fetch ist auf Claude Opus 5 nicht verfügbar, und Priority Tier wird auf Claude Opus 5 nicht unterstützt. Es fügt außerdem System-Nachrichten mitten in der Konversation hinzu und dokumentiert Stop-Details bei Ablehnungen öffentlich. Auf der Claude API und Google Cloud unterstützt Claude Opus 5 außerdem „computer use“ (Computernutzung) als stabiles Toolset computer_toolset_20260801 und das Browser-Use-Tool für Aufgaben innerhalb von Webseiten, die Claude Opus 4.7 beide nicht unterstützt; bestehende Integrationen auf der früheren Version computer_20251124 funktionieren auf beiden Modellen unverändert weiter. Um eine bestehende Integration zu aktualisieren, siehe Migration von computer_20251124.

Aktualisiere deinen Modellnamen

# Opus-Migration
model = "claude-opus-4-7"  # Before
model = "claude-opus-5"  # After

Breaking Changes

  1. Denken standardmäßig aktiviert: Auf Claude Opus 4.7 laufen Anfragen ohne thinking-Feld ohne Denken; auf Claude Opus 5 laufen dieselben Anfragen mit adaptivem Denken. max_tokens bleibt eine harte Obergrenze für die gesamte Ausgabe, Denken plus Antworttext, also überprüfe den Wert für Workloads, die auf Claude Opus 4.7 ohne Denken liefen. Thinking-Token werden als Output-Token abgerechnet, auch wenn der Denktext nicht an dich zurückgegeben wird. Obwohl der Preis pro Token unverändert ist, kann ein Workload, der auf Claude Opus 4.7 ohne Denken lief, auf Claude Opus 5 daher mehr Output-Token pro Anfrage erzeugen; siehe Kostenkontrolle. Um das alte Verhalten beizubehalten, übergib thinking: {type: "disabled"}, vorbehaltlich der Effort-Obergrenze im nächsten Punkt. Beachte, dass das Modell bei deaktiviertem Denken gelegentlich Tool-Aufrufe als Klartext ausgeben oder interne XML-Tags in seine sichtbare Ausgabe aufnehmen kann. Bevorzuge daher, wo möglich, niedrigere Effort-Stufen mit aktiviertem Denken, und siehe Betrieb mit deaktiviertem Denken für Gegenmaßnahmen, wo das nicht möglich ist.

    Die Form der Antwort ändert sich damit ebenfalls. Bei aktiviertem Denken kann eine Antwort mit einem oder mehreren thinking-Blöcken vor dem ersten text-Block beginnen, und da thinking.display auf Claude Opus 5 standardmäßig "omitted" ist, kommen diese Blöcke mit einem leeren thinking-Feld neben ihrer signature an. Code, der die Antwort nach Position liest, etwa content[0].text oder ein Stream-Handler, der das erste content_block_start-Event als Text behandelt, bricht bei diesen Antworten. Wähle Content-Blöcke stattdessen anhand ihres type-Felds aus: Lies text aus den Blöcken, deren type "text" ist, und verzweige bei der Verarbeitung von Stream-Events nach dem Blocktyp. Um lesbare Denkzusammenfassungen statt eines leeren thinking-Felds zu erhalten, setze display: "summarized"; siehe Steuerung der Thinking-Anzeige.

    Wenn du eine Tool-Use-Schleife betreibst, gib die thinking-Blöcke aus jeder Assistant-Antwort vollständig und unverändert an die API zurück, wenn du Tool-Ergebnisse zurückgibst, einschließlich der Blöcke, deren thinking-Feld leer ist. Gib die Assistant-Nachricht so zurück, wie du sie erhalten hast, anstatt ihre Content-Blöcke nach Typ zu filtern oder sie neu aufzubauen: Die API lehnt bearbeitete, umsortierte oder teilweise entfernte Thinking-Blöcke mit einem 400-Fehler ab. Siehe Thinking-Blöcke beibehalten.

  2. Das Deaktivieren des Denkens ist auf Effort high begrenzt: Du kannst das Denken mit thinking: {type: "disabled"} ausschalten, aber nur auf einer Effort-Stufe von high oder darunter. Eine Anfrage, die thinking: {type: "disabled"} mit Effort xhigh oder max kombiniert, gibt einen 400-Fehler zurück. Claude Opus 4.7 akzeptiert diese Kombination, also prüfe Anfragen, die das Denken deaktivieren, bevor du migrierst.

    Die Prüfung wird bei jeder Anfrage durchgesetzt: Die Effort- und Thinking-Konfiguration jeder Anfrage wird unabhängig validiert, sodass eine Anfrage, die den Effort bei deaktiviertem Denken auf xhigh oder max anhebt, abgelehnt wird, selbst wenn frühere Anfragen in der Konversation akzeptiert wurden.

    Vorher (auf Claude Opus 4.7 akzeptiert, auf Claude Opus 5 abgelehnt):

    client.messages.create(
        model="claude-opus-4-7",
        max_tokens=16000,
        thinking={"type": "disabled"},
        output_config={"effort": "xhigh"},
        messages=[{"role": "user", "content": "..."}],
    )

    Nachher (Claude Opus 5): Entferne entweder das thinking-Feld, um mit Denken zu arbeiten:

    client.messages.create(
        model="claude-opus-5",
        max_tokens=16000,
        output_config={"effort": "xhigh"},  # thinking is on by default
        messages=[{"role": "user", "content": "..."}],
    )

    oder lass das Denken deaktiviert und senke den Effort:

    client.messages.create(
        model="claude-opus-5",
        max_tokens=16000,
        thinking={"type": "disabled"},
        output_config={"effort": "high"},  # or "medium", "low"
        messages=[{"role": "user", "content": "..."}],
    )

Was sich geändert hat

Die folgenden Punkte sind keine Breaking Changes; sie beschreiben Verhaltensunterschiede, die du nach dem Austausch der Modell-ID prüfen solltest.

  1. Sampling-Parameter (unverändert): Das Setzen von temperature, top_p oder top_k auf einen Nicht-Standardwert gibt auf Claude Opus 5 einen 400-Fehler zurück, genau wie auf Claude Opus 4.7. Die meisten SDKs definieren diese Felder aus Kompatibilitätsgründen mit früheren Modellen weiterhin, sodass Code, der sie setzt, die Typprüfung besteht, obwohl die API die Anfrage ablehnt. Das Python SDK (v1.0 und später) definiert sie nicht, und ihre Übergabe löst einen TypeError aus. Wenn du diese Parameter bei der Migration zu Opus 4.7 entfernt hast, sind keine weiteren Änderungen nötig.

  2. Effort-Standard ist high: Der Standardwert des Effort-Parameters auf Claude Opus 5 ist high auf der Claude API und in Claude Code. Wenn du den Effort bereits explizit setzt, bleibt deine Einstellung unverändert.

  3. Effort-Stufen neu kalibriert: Die Token-Zuteilung hinter jeder Effort-Stufe ändert sich auf Claude Opus 5 im Vergleich zu Claude Opus 4.7, und Claude Opus 5 unterstützt den vollständigen Satz an Effort-Stufen (low, medium, high, xhigh, max). Führe einen frischen Effort-Sweep auf deinen eigenen Evals durch, statt eine für Claude Opus 4.7 abgestimmte Einstellung zu übernehmen. Effort low und medium sind als Kosten- und Latenzsteuerung einen Test wert, und teste Effort max, wo maximale Leistungsfähigkeit wichtiger ist als Token-Verbrauch. Wenn du mit Effort xhigh oder max arbeitest, setze ein großes max_tokens, damit das Modell Raum zum Denken und Handeln hat; beginne bei 64k Token und justiere von dort aus. Siehe Effort.

  4. Kontextfenster mit 1 Mio. Token ist der Standard: Claude Opus 5 stellt standardmäßig das volle Kontextfenster mit 1 Mio. Token bereit, ohne Beta-Header und ohne Long-Context-Aufpreis. Wenn dein Client aus Kompatibilitätsgründen mit älteren Modellen einen Kontextfenster-Beta-Header übergibt, kannst du ihn auf Claude Opus 5 entfernen.

  5. System-Nachrichten mitten in der Konversation: Claude Opus 5 akzeptiert role: "system"-Nachrichten unmittelbar nach einem User-Turn im messages-Array (vorbehaltlich der Platzierungsregeln). Verwende das Top-Level-Feld system für Anweisungen, die von Anfang an gelten. Claude Opus 4.7 lehnt role: "system" in messages mit einem 400-Fehler ab. Wenn du Codepfade pflegst, die den gesamten Nachrichtenverlauf neu aufbauen, um Anweisungen zu aktualisieren, kannst du sie vereinfachen und Prompt-Cache-Treffer auf früheren Turns erhalten.

  6. Stop-Details bei Ablehnungen: Das stop_details-Objekt bei Ablehnungsantworten (verfügbar seit Claude Opus 4.7) ist jetzt öffentlich dokumentiert. Wenn das Modell eine Anfrage ablehnt, gibt es zusätzlich zum bestehenden Stop-Reason refusal die Kategorie der Ablehnung an. Es ist kein Beta-Header erforderlich, und es gibt kein Opt-out. Siehe Umgang mit Stop-Reasons.

  7. Niedrigeres Prompt-Caching-Minimum: Die minimale cachebare Prompt-Länge auf Claude Opus 5 beträgt 512 Token, niedriger als auf Claude Opus 4.7. Prompts, die auf Claude Opus 4.7 zu kurz zum Cachen waren, können jetzt Cache-Einträge erzeugen, ohne dass Codeänderungen erforderlich sind. Siehe Prompt-Caching für die Mindestwerte pro Modell.

  8. Fast Mode: Claude Opus 5 unterstützt „fast mode“ (Schnellmodus) (Research Preview); Fast Mode ist auf Claude Opus 4.7 nicht verfügbar, wo Anfragen mit speed: "fast" einen Fehler zurückgeben. Der Parameter speed: "fast" und der Beta-Header fast-mode-2026-02-01 funktionieren auf Claude Opus 5 unverändert.

Diese sind nicht erforderlich, verbessern aber deine Erfahrung:

  1. Erwäge automatische Fallbacks: Claude Opus 5 wird mit Cybersecurity-Sicherheitsklassifikatoren ausgeliefert, deren Ablehnungen in der Cyber-Kategorie auf Claude Opus 4.8 zurückfallen können. Um abgelehnte Anfragen automatisch auf einem anderen Modell erneut auszuführen, erwäge den Parameter fallbacks mit dem Modus "default" (fallbacks: "default"), der anhand der Ablehnungskategorie ein empfohlenes Fallback-Modell auswählt, statt einer manuell gepflegten Modellliste. Serverseitiges Fallback ist in der Beta; der Modus "default" erfordert den Beta-Header server-side-fallback-2026-07-01. Siehe Ablehnungen und Fallback.

  2. Ändere Tools mitten in der Konversation (Beta): Du kannst zwischen den Turns einer Konversation Tools hinzufügen oder entfernen, ohne Prompt-Cache-Treffer auf früheren Turns ungültig zu machen. Sende den Beta-Header mid-conversation-tool-changes-2026-07-01. Das ist nützlich für agentische Workloads, die Tools schrittweise freigeben oder sie im Verlauf einer Aufgabe zurückziehen; ohne ihn macht eine geänderte Tool-Liste das gecachte Präfix ungültig.

  3. Stimme Prompts zu Länge und Ausführlichkeit neu ab: Standardmäßige sichtbare Antworten und schriftliche Arbeitsergebnisse fallen auf Claude Opus 5 länger aus als auf früheren Opus-Modellen, und ein niedrigerer Effort reduziert das Denkvolumen, ohne die sichtbare Antwort zuverlässig zu verkürzen. Fordere stattdessen explizit Prägnanz oder eine Ziellänge an. Siehe Antwortlänge und Ausführlichkeit und Länge schriftlicher Arbeitsergebnisse.

  4. Entferne übernommene Verifizierungsanweisungen und begrenze den Umfang: Claude Opus 5 überprüft seine eigene Arbeit, ohne dazu aufgefordert zu werden. Entferne daher explizite Verifizierungs- oder Selbstprüfungsanweisungen, die aus für frühere Modelle abgestimmten Prompts übernommen wurden; sie beizubehalten führt zu Überverifizierung. Begrenze bei eng gefassten Aufgaben den Aufgabenumfang explizit. Gib in Multi-Agenten-Frameworks explizite Hinweise, welche Szenarien eine Delegation rechtfertigen, oder begrenze die Anzahl der Subagenten, da Claude Opus 5 bereitwilliger delegiert als frühere Modelle. Siehe Aufgabenumfang und Überverifizierung und Steuerung des Startens von Subagenten.

Migrations-Checkliste

  • Aktualisiere den Modellnamen von claude-opus-4-7 auf claude-opus-5 (oder aktualisiere Aliasse).
  • Überprüfe Workloads, die ohne thinking-Feld liefen: Sie laufen auf Claude Opus 5 mit Denken. Überprüfe max_tokens, das eine harte Obergrenze für die gesamte Ausgabe (Denken plus Antworttext) bleibt, oder übergib thinking: {type: "disabled"} bei Effort high oder darunter, um das alte Verhalten beizubehalten. Wenn du das Denken deaktivierst, lies Betrieb mit deaktiviertem Denken zu den Ausgabeartefakten, die auftreten können, und den entsprechenden Prompting-Gegenmaßnahmen.
  • Aktualisiere Antwort-Parsing, das Inhalte nach Position liest, etwa content[0].text oder einen Stream-Handler, der annimmt, dass der erste Content-Block Text ist: Bei aktiviertem Denken kommen thinking-Blöcke vor text-Blöcken an. Wähle Content-Blöcke stattdessen nach type aus.
  • Wenn du eine Tool-Use-Schleife betreibst, gib thinking-Blöcke vollständig und unverändert zurück, wenn du Tool-Ergebnisse zurückgibst; veränderte Blöcke führen zu einem 400-Fehler. Siehe Thinking-Blöcke beibehalten.
  • Stelle sicher, dass jeder Code, der das thinking-Feld parst, es nur als Anzeigetext behandelt. thinking.display ist auf Claude Opus 5 standardmäßig "omitted", genau wie auf Claude Opus 4.7, sodass Thinking-Blöcke mit einem leeren thinking-Feld ankommen; setze display: "summarized", um lesbare Zusammenfassungen zu erhalten. Siehe Steuerung der Thinking-Anzeige.
  • Prüfe Anfragen, die das Denken deaktivieren: thinking: {type: "disabled"} mit Effort xhigh oder max gibt einen 400-Fehler zurück, durchgesetzt bei jeder Anfrage. Aktiviere das Denken wieder oder senke den Effort auf high oder darunter.
  • Wenn du Sampling-Parameter während der Migration zu Opus 4.7 entfernt hast, ist keine Aktion nötig. Wenn du sie mit einem 400-Retry-Pfad wieder hinzugefügt hast, entferne diesen Retry-Pfad.
  • Bewerte deine effort-Einstellung neu: Führe einen frischen Effort-Sweep auf deinen eigenen Evals durch, statt eine für Claude Opus 4.7 abgestimmte Einstellung zu übernehmen. Teste Effort low und medium als Kosten- und Latenzsteuerung und Effort max, wo maximale Leistungsfähigkeit wichtiger ist als Token-Verbrauch. Wenn du mit Effort xhigh oder max arbeitest, erhöhe max_tokens als Ausgangspunkt auf mindestens 64k.
  • Entferne jeglichen Kontextfenster-Beta-Header. Das Kontextfenster mit 1 Mio. Token ist der Standard auf der Claude API, Amazon Bedrock, Google Cloud und Microsoft Foundry.
  • Wenn du den Konversationsverlauf neu aufbaust, um Anweisungen zu aktualisieren, erwäge den Wechsel zu einer System-Nachricht mitten in der Konversation, um Prompt-Cache-Treffer zu erhalten.
  • Stelle sicher, dass deine Stop-Reason-Behandlung bei Ablehnungen stop_details liest (verfügbar seit Claude Opus 4.7; jetzt öffentlich dokumentiert), und erwäge fallbacks: "default" (Beta), um abgelehnte Anfragen automatisch auf einem empfohlenen Fallback-Modell erneut auszuführen.
  • Überprüfe Prompts nahe dem Caching-Minimum: Prompts mit 512 Token oder mehr können jetzt Cache-Einträge erzeugen.
  • Wenn du Web Fetch verwendest, plane eine Alternative: Es ist auf Claude Opus 5 nicht verfügbar.
  • Wenn deine Organisation eine Priority Tier-Zusage hat, beachte, dass Priority Tier auf Claude Opus 5 nicht unterstützt wird.
  • Wenn du Fast Mode auf Claude Opus 4.7 verwendet hast, sind über die Modell-ID hinaus keine Änderungen an Anfragen nötig: speed: "fast" und der Beta-Header fast-mode-2026-02-01 funktionieren auf Claude Opus 5 unverändert.
  • Erwäge für agentische Workloads Task-Budgets (Beta) und Tool-Änderungen mitten in der Konversation (Beta).
  • Stimme Prompts zu Länge und Ausführlichkeit neu ab und entferne Verifizierungs- und Selbstprüfungsanweisungen, die aus für frühere Modelle abgestimmten Prompts übernommen wurden.
  • Ermittle Kosten und Latenz auf deiner gewählten Effort-Stufe neu. Der Preis pro Token ist gegenüber Claude Opus 4.7 unverändert, aber Thinking-Token werden als Output-Token abgerechnet, sodass Workloads, die ohne Denken liefen, mehr Output-Token pro Anfrage erzeugen können.

Migration zu Claude Opus 5 von Claude Opus 4.6 und früheren Opus-Modellen

Claude Opus 5 sollte auf bestehenden Prompts und Evals für Claude Opus 4.6 zum gleichen Preis eine starke Out-of-the-box-Leistung zeigen, aber es gibt eine Handvoll Verhaltens- und API-Änderungen, die du bei der Migration kennen solltest. Die meisten dieser Änderungen traten mit Claude Opus 4.7 in Kraft; zwei weitere, standardmäßig aktiviertes Denken und eine Effort-Obergrenze für das Deaktivieren des Denkens, treten mit Claude Opus 5 in Kraft. Alle werden in diesem Abschnitt behandelt, sodass er für Code, der direkt von Claude Opus 4.6 kommt, vollständig ist. Claude Opus 5 unterstützt denselben Funktionsumfang wie Claude Opus 4.6, einschließlich:

Zwei Ausnahmen: Web Fetch ist auf Claude Opus 5 nicht verfügbar, und Priority Tier wird auf Claude Opus 5 nicht unterstützt. Auf der Claude API und Google Cloud unterstützt Claude Opus 5 außerdem Computer Use als stabiles Toolset computer_toolset_20260801 und das Browser-Use-Tool für Aufgaben innerhalb von Webseiten, die weder Claude Opus 4.6 noch frühere Opus-Modelle unterstützen; bestehende Integrationen auf der früheren Version computer_20251124 funktionieren auf Claude Opus 5 unverändert weiter. Um eine bestehende Integration zu aktualisieren, siehe Migration von computer_20251124.

Aktualisiere deinen Modellnamen

# Opus-Migration
model = "claude-opus-4-6"  # Before
model = "claude-opus-5"  # After

Breaking Changes

  1. Erweitertes Denken entfernt: thinking: {type: "enabled", budget_tokens: N} wird auf Claude Opus 4.7 oder späteren Modellen nicht mehr unterstützt und gibt einen 400-Fehler zurück. Wechsle zu adaptivem Denken (thinking: {type: "adaptive"}) und verwende den Effort-Parameter, um die Denktiefe zu steuern. Auf Claude Opus 5 ist adaptives Denken standardmäßig aktiviert: thinking: {type: "adaptive"} ist gültig und entspricht dem vollständigen Weglassen des thinking-Felds (siehe nächster Punkt).

    Vorher (Claude Opus 4.6):

    client.messages.create(
        model="claude-opus-4-6",
        max_tokens=16000,
        thinking={"type": "enabled", "budget_tokens": 10000},
        messages=[{"role": "user", "content": "..."}],
    )

    Nachher (Claude Opus 5):

    client.messages.create(
        model="claude-opus-5",
        max_tokens=16000,
        thinking={"type": "adaptive"},
        output_config={"effort": "high"},  # or "max", "xhigh", "medium", "low"
        messages=[{"role": "user", "content": "..."}],
    )

    Adaptives Denken lässt sich über Prompting und den Effort-Parameter steuern; siehe Ein Effort-Level wählen.

  2. Denken standardmäßig aktiviert: Auf Claude Opus 4.6 und Claude Opus 4.7 laufen Anfragen ohne thinking-Feld ohne Denken; auf Claude Opus 5 laufen dieselben Anfragen mit adaptivem Denken. max_tokens bleibt ein hartes Limit für die gesamte Ausgabe, Denken plus Antworttext, überprüfe es also für Workloads, die bisher ohne Denken liefen. Denk-Token werden als Ausgabe-Token abgerechnet, auch wenn der Denktext nicht an dich zurückgegeben wird. Obwohl die Preise pro Token unverändert sind, kann ein Workload, der bisher ohne Denken lief, auf Claude Opus 5 daher mehr Ausgabe-Token pro Anfrage erzeugen; siehe Kostenkontrolle. Um das alte Verhalten beizubehalten, übergib thinking: {type: "disabled"}, vorbehaltlich der Effort-Obergrenze im nächsten Punkt; beachte, dass das Modell bei deaktiviertem Denken gelegentlich Tool-Aufrufe als Klartext ausgeben oder interne XML-Tags in seine sichtbare Ausgabe aufnehmen kann. Bevorzuge daher, wo möglich, niedrigere Effort-Level mit aktiviertem Denken, und siehe Betrieb mit deaktiviertem Denken für Gegenmaßnahmen, wo das nicht möglich ist.

    Die Form der Antwort ändert sich damit ebenfalls. Bei aktiviertem Denken kann eine Antwort mit einem oder mehreren thinking-Blöcken vor dem ersten text-Block beginnen, und da Denkinhalte auf Claude Opus 5 standardmäßig weggelassen werden (Punkt 5 in dieser Liste), kommen diese Blöcke mit einem leeren thinking-Feld neben ihrer signature an. Code, der die Antwort nach Position liest, etwa content[0].text oder ein Stream-Handler, der das erste content_block_start-Event als Text behandelt, bricht bei diesen Antworten. Wähle Inhaltsblöcke stattdessen nach ihrem type-Feld aus: Lies text aus den Blöcken, deren type "text" ist, und verzweige bei der Verarbeitung von Stream-Events nach dem Blocktyp.

    Wenn du eine Tool-Nutzungs-Schleife betreibst, gib die thinking-Blöcke aus jeder Assistant-Antwort vollständig und unverändert an die API zurück, wenn du Tool-Ergebnisse zurückgibst, einschließlich der Blöcke, deren thinking-Feld leer ist. Gib die Assistant-Nachricht so zurück, wie du sie erhalten hast, anstatt ihre Inhaltsblöcke nach Typ zu filtern oder sie neu aufzubauen: Die API lehnt bearbeitete, umsortierte oder teilweise entfernte Thinking-Blöcke mit einem 400-Fehler ab. Siehe Thinking-Blöcke bewahren.

  3. Deaktivieren des Denkens ist auf Effort high begrenzt: Du kannst das Denken mit thinking: {type: "disabled"} ausschalten, aber nur bei einem Effort-Level von high oder darunter. Eine Anfrage, die thinking: {type: "disabled"} mit Effort xhigh oder max kombiniert, gibt auf Claude Opus 5 einen 400-Fehler zurück, was bei jeder Anfrage durchgesetzt wird. Prüfe Anfragen, die das Denken deaktivieren, bevor du migrierst: Aktiviere das Denken wieder oder senke den Effort auf high oder darunter.

  4. Sampling-Parameter entfernt: Das Setzen von temperature, top_p oder top_k auf einen beliebigen Nicht-Standardwert auf Claude Opus 4.7 oder späteren Modellen, einschließlich Claude Opus 5, gibt einen 400-Fehler zurück. Das Python SDK (v1.0 und später) definiert sie nicht, und ihre Übergabe löst einen TypeError aus. Der sicherste Migrationspfad ist, diese Parameter vollständig aus den Anfrage-Payloads wegzulassen. Prompting ist der empfohlene Weg, um das Modellverhalten auf Claude Opus 5 zu steuern. Falls du temperature = 0 für Determinismus verwendet hast, beachte, dass dies auch auf früheren Modellen nie identische Ausgaben garantiert hat.

  5. Denkinhalte standardmäßig weggelassen: Thinking-Blöcke erscheinen auf Claude Opus 4.7 und späteren Modellen weiterhin im Antwort-Stream, aber ihr thinking-Feld ist leer, sofern du dich nicht ausdrücklich dafür entscheidest. Dies ist eine stille Änderung gegenüber Claude Opus 4.6, wo standardmäßig zusammengefasster Denktext zurückgegeben wurde. Um zusammengefasste Denkinhalte wiederherzustellen, setze thinking.display auf "summarized":

    thinking = {
        "type": "adaptive",
        "display": "summarized",
    }

    Der Standardwert ist "omitted" auf Claude Opus 4.7 und späteren Modellen. Wenn dein Produkt Reasoning an Nutzer streamt, erscheint der neue Standard als lange Pause, bevor die Ausgabe beginnt; setze display: "summarized", um sichtbaren Fortschritt während des Denkens wiederherzustellen. Siehe Anzeige des Denkens steuern für Details.

  6. Aktualisierte Token-Zählung: Claude Opus 4.7 hat einen neuen Tokenizer eingeführt, den auch spätere Opus-Modelle, einschließlich Claude Opus 5, verwenden. Er trägt zu einer verbesserten Leistung bei einer Vielzahl von Aufgaben bei und kann bei der Verarbeitung von Text etwa 1x bis 1,35x so viele Token verwenden wie Modelle vor Claude Opus 4.7 (bis zu ~35 % mehr, je nach Inhalt unterschiedlich).

    /v1/messages/count_tokens gibt für Claude Opus 5 eine andere Anzahl von Token zurück als für Claude Opus 4.6. Die Token-Effizienz kann je nach Form des Workloads variieren.

    Prompting-Eingriffe, task_budget und effort können helfen, Kosten zu kontrollieren und eine angemessene Token-Nutzung sicherzustellen. Diese Steuerungen können auf Kosten der Modellintelligenz gehen. Aktualisiere deine max_tokens-Parameter, um zusätzlichen Spielraum zu schaffen, einschließlich Compaction-Triggern. Claude Opus 5 bietet ein 1M-Kontextfenster zu Standard-API-Preisen ohne Long-Context-Aufschlag.

  7. Prefill-Entfernung (übernommen von Opus 4.6): Das Vorbefüllen von Assistant-Nachrichten gibt auf Claude Opus 4.7 und späteren Modellen, einschließlich Claude Opus 5, einen 400-Fehler zurück. Verwende stattdessen strukturierte Ausgaben, Anweisungen im System-Prompt oder output_config.format.

Ein Effort-Level wählen

Der Effort-Parameter ermöglicht es dir, Claudes Intelligenz gegen den Token-Verbrauch abzustimmen und Fähigkeit gegen höhere Geschwindigkeit und niedrigere Kosten einzutauschen. Claude Opus 5 unterstützt den vollständigen Satz an Effort-Levels und verwendet standardmäßig high. Führe einen neuen Effort-Sweep auf deinen eigenen Evals durch, anstatt eine für ein früheres Modell abgestimmte Einstellung zu übernehmen:

  • max: Kann bei den anspruchsvollsten Aufgaben Gewinne bringen, zeigt aber möglicherweise abnehmende Erträge durch erhöhten Token-Verbrauch und kann bei einfacheren Aufgaben zum Überdenken neigen. Teste es dort, wo maximale Fähigkeit wichtiger ist als der Token-Verbrauch.
  • xhigh: Erweiterte Fähigkeit für lang laufende agentische und Coding-Arbeit, die mehr Tiefe als der Standard benötigt.
  • high: Der Standard. Balanciert Token-Verbrauch und Intelligenz für die meisten Aufgaben.
  • medium: Kostensparende Stufe unterhalb des Standards, die sich als Kosten- und Latenzsteuerung zu testen lohnt.
  • low: Am effizientesten. Reserviere es für kurze, klar abgegrenzte Aufgaben und latenzempfindliche Workloads.

Wenn du mit Effort xhigh oder max arbeitest, setze ein großes max_tokens, damit das Modell Raum zum Denken und Handeln hat; beginne bei 64k Token und stimme von dort aus ab. Effort ist für dieses Modell wichtiger als für jedes frühere Opus. Experimentiere aktiv damit, wenn du upgradest.

Verhaltensänderungen

Claude Opus 4.7 hat mehrere Verhaltensunterschiede gegenüber Claude Opus 4.6 eingeführt, die keine API-Breaking-Changes sind, aber möglicherweise Prompt-Aktualisierungen oder das Entfernen von Scaffolding erfordern. Sie gelten weiterhin für Claude Opus 5, mit den in dieser Liste vermerkten Anpassungen.

  1. Antwortlänge variiert je nach Anwendungsfall: Claude Opus 4.7 kalibriert die Antwortlänge danach, wie komplex es die Aufgabe einschätzt, anstatt standardmäßig eine feste Ausführlichkeit zu verwenden. Das bedeutet in der Regel kürzere Antworten bei einfachen Nachschlagefragen und deutlich längere bei offenen Analysen.

    Wenn dein Produkt von einem bestimmten Stil oder einer bestimmten Ausführlichkeit der Ausgabe abhängt, musst du möglicherweise deine Prompts anpassen. Um beispielsweise die Ausführlichkeit zu verringern, füge hinzu: „Provide concise, focused responses. Skip non-essential context, and keep examples minimal.“ Wenn du bestimmte Arten von Übererklärung beobachtest, füge gezielte Anweisungen in deinen Prompt ein, um sie zu verhindern.

    Positive Beispiele, die zeigen, wie Claude mit dem angemessenen Maß an Prägnanz kommunizieren kann, sind tendenziell wirksamer als negative Beispiele oder Anweisungen, die dem Modell sagen, was es nicht tun soll. Auf Claude Opus 5 fallen standardmäßige sichtbare Antworten und schriftliche Ergebnisse länger aus als auf früheren Opus-Modellen, und das Senken des Efforts reduziert das Denkvolumen, ohne die sichtbare Antwort zuverlässig zu verkürzen; fordere Prägnanz oder eine Ziellänge ausdrücklich im Prompt an. Siehe Antwortlänge und Ausführlichkeit.

  2. Wörtlichere Befolgung von Anweisungen: Claude Opus 4.7 interpretiert Prompts wörtlicher und expliziter als Claude Opus 4.6, insbesondere bei niedrigeren Effort-Levels. Es verallgemeinert eine Anweisung nicht stillschweigend von einem Element auf ein anderes und leitet keine Anfragen ab, die du nicht gestellt hast. Der Vorteil dieser Wörtlichkeit ist Präzision und weniger Hin und Her. Es schneidet im Allgemeinen besser ab bei API-Anwendungsfällen mit sorgfältig abgestimmten Prompts, strukturierter Extraktion und Pipelines, in denen du vorhersagbares Verhalten möchtest. Eine Überprüfung von Prompt und Harness kann für die Migration zu Claude Opus 5 besonders hilfreich sein.

  3. Direkterer Ton: Wie bei jedem neuen Modell kann sich der Prosastil bei längeren Texten verschieben. Claude Opus 4.7 ist direkter und meinungsstärker, mit weniger bestätigungsorientierten Formulierungen und weniger Emoji als der wärmere Stil von Claude Opus 4.6. Wenn dein Produkt auf eine bestimmte Stimme angewiesen ist, bewerte Stil-Prompts anhand der neuen Baseline neu.

  4. Eingebaute Fortschrittsupdates in agentischen Traces: Claude Opus 4.7 liefert dem Nutzer während langer agentischer Traces regelmäßigere, hochwertigere Updates. Wenn du Scaffolding hinzugefügt hast, um Zwischenstatusmeldungen zu erzwingen („After every 3 tool calls, summarize progress“), versuche, es zu entfernen. Wenn du feststellst, dass Länge oder Inhalt der nutzerseitigen Updates von Claude Opus 4.7 nicht gut auf deinen Anwendungsfall kalibriert sind, beschreibe im Prompt ausdrücklich, wie diese Updates aussehen sollen, und gib Beispiele an.

  5. Subagent-Spawning geändert: Claude Opus 4.7 neigt dazu, standardmäßig weniger Subagenten zu starten als Claude Opus 4.6, während Claude Opus 5 bereitwilliger an Subagenten delegiert als frühere Modelle. Das Verhalten lässt sich über Prompting in beide Richtungen steuern; gib ausdrückliche Hinweise, wann Subagenten erwünscht sind, oder begrenze die Anzahl der Subagenten. Siehe Subagent-Spawning steuern.

  6. Strengere Effort-Kalibrierung: Als deutliche Änderung gegenüber Claude Opus 4.6 respektiert Claude Opus 4.7 Effort-Levels strikt, insbesondere am unteren Ende. Bei low und medium beschränkt das Modell seine Arbeit auf das, was gefragt wurde, anstatt mehr als verlangt zu tun.

    Das ist gut für Latenz und Kosten, aber bei mäßig komplexen Aufgaben, die mit Effort low laufen, besteht ein gewisses Risiko des Unterdenkens. Wenn du bei komplexen Problemen oberflächliches Reasoning beobachtest, erhöhe den Effort auf high oder xhigh, anstatt per Prompt darum herumzuarbeiten.

    Wenn du den Effort aus Latenzgründen auf low halten musst, füge gezielte Hinweise hinzu: „This task involves multistep reasoning. Think carefully through the problem before responding.“ Siehe Empfohlene Effort-Levels für Claude Opus 4.7.

  7. Standardmäßig weniger Tool-Aufrufe: Claude Opus 4.7 neigt dazu, Tools seltener zu verwenden als Claude Opus 4.6 und stärker auf Reasoning zu setzen. Das führt in den meisten Fällen zu besseren Ergebnissen.

    Um die Tool-Nutzung zu erhöhen, erhöhe die Effort-Einstellung. Die Effort-Einstellungen high oder xhigh zeigen deutlich mehr Tool-Nutzung bei agentischer Suche und Coding. Du kannst auch deinen Prompt anpassen, um das Modell ausdrücklich anzuweisen, wann und wie es seine Tools richtig verwenden soll.

  8. Echtzeit-Cybersicherheits-Schutzmaßnahmen: Neu in Claude Opus 4.7 hinzugefügt: Anfragen, die verbotene oder hochriskante Themen betreffen, können zu Ablehnungen führen. Für legitime Sicherheitsarbeit wie Penetrationstests, Schwachstellenforschung oder Red-Teaming bewirb dich beim Cyber Verification Program, um reduzierte Einschränkungen zu beantragen. Der Bewerbungsweg hängt davon ab, wie du auf Claude zugreifst.

  9. Unterstützung hochauflösender Bilder: Claude Opus 4.7 ist das erste Claude-Modell mit Unterstützung für hochauflösende Bilder. Die maximale Bildauflösung beträgt 2.576 Pixel an der langen Kante, gegenüber 1.568 Pixeln bei früheren Modellen. Das ermöglicht Gewinne bei visionslastigen Workloads und ist besonders wertvoll für Computer Use, Screenshot-Verständnis und Dokumentenanalyse.

    Die Unterstützung hoher Auflösung ist automatisch und erfordert keinen Beta-Header oder clientseitiges Opt-in. Zwei Dinge, die du einplanen solltest:

    • Bilder in voller Auflösung können bis zu etwa 3x mehr Bild-Token verbrauchen als bei früheren Modellen (bis zu 4.784 Token pro Bild, verglichen mit der bisherigen Obergrenze von etwa 1.600 Token pro Bild). Plane max_tokens und Kostenerwartungen für bildlastige Workloads neu, oder skaliere vor dem Senden herunter, wenn du die zusätzliche Detailtreue nicht benötigst.
    • Vom Modell zurückgegebene Zeige- und Bounding-Box-Koordinaten entsprechen auf Claude Opus 4.7 1:1 den tatsächlichen Bildpixeln, sodass keine Skalierungsfaktor-Umrechnung erforderlich ist.

    Siehe Unterstützung hochauflösender Bilder auf Claude Opus 4.7 für Details.

Diese sind nicht erforderlich, verbessern aber deine Erfahrung:

  1. max_tokens neu bewerten: Da derselbe Text auf Claude Opus 4.7 und späteren Modellen eine höhere Token-Anzahl erzeugt, aktualisiere deine max_tokens-Parameter, um zusätzlichen Spielraum zu schaffen, einschließlich Compaction-Triggern. Prompting-Eingriffe, task_budget und effort können helfen, Kosten zu kontrollieren und eine angemessene Token-Nutzung sicherzustellen.

  2. Erwartungen an Token-Zählungen prüfen: Jeder Codepfad, der Token clientseitig schätzt oder ein festes Token-zu-Zeichen-Verhältnis annimmt, sollte gegen Claude Opus 5 neu getestet werden. Verwende den Token-Counting-Endpunkt zur Überprüfung.

  3. Task-Budgets einführen (Beta): Claude Opus 4.7 führt Task-Budgets ein. Mit diesen Budgets kannst du Claude mitteilen, wie viele Token es für eine vollständige agentische Schleife zur Verfügung hat, einschließlich Denken, Tool-Aufrufen, Tool-Ergebnissen und finaler Ausgabe. Das Modell sieht einen laufenden Countdown und nutzt ihn, um Arbeit zu priorisieren und die Aufgabe geordnet abzuschließen, während das Budget verbraucht wird. Zur Verwendung setze den Beta-Header task-budgets-2026-03-13 und füge Folgendes zu deiner Output-Config hinzu:

    output_config = {
        "effort": "high",
        "task_budget": {"type": "tokens", "total": 128000},
    }

    Möglicherweise musst du für deinen Anwendungsfall mit verschiedenen Task-Budgets experimentieren. Wenn dem Modell ein zu restriktives Task-Budget gegeben wird, erledigt es die Aufgabe möglicherweise weniger gründlich und verweist auf sein Budget als Einschränkung.

    Für offene agentische Aufgaben, bei denen Qualität wichtiger ist als Geschwindigkeit, setze kein Task-Budget. Reserviere Task-Budgets für Workloads, bei denen das Modell seine Arbeit auf ein Token-Kontingent beschränken soll. Der Mindestwert für ein Task-Budget beträgt 20k Token.

    Ein Task-Budget ist keine harte Obergrenze; es ist ein Vorschlag, der dem Modell bekannt ist. Es unterscheidet sich von max_tokens:

    • task_budget: eine beratende Obergrenze über die gesamte agentische Schleife. Das Modell sieht sie und nutzt sie, um sein Tempo zu steuern.
    • max_tokens: eine harte Obergrenze pro Anfrage für generierte Token. Sie wird nicht an das Modell übergeben, sodass das Modell sie nicht kennt.

    Verwende task_budget, wenn das Modell sich selbst mäßigen soll, und max_tokens als harte Obergrenze, um die Nutzung zu begrenzen.

  4. Ein großes max_tokens bei Effort max oder xhigh setzen: Wenn du Claude Opus 4.7 oder ein späteres Modell mit Effort max oder xhigh betreibst, setze ein großes maximales Ausgabe-Token-Budget, damit das Modell Raum hat, über seine Subagenten und Tool-Aufrufe hinweg zu denken und zu handeln. Beginne bei 64k Token und stimme von dort aus ab.

  5. Bilder herunterskalieren, wenn hohe Auflösung unnötig ist: Claude Opus 4.7 und spätere Modelle unterstützen Bilder bis zu 2576px / 3,75MP. Hochauflösende Bilder verbrauchen mehr Token. Wenn die zusätzliche Bilddetailtreue unnötig ist, skaliere Bilder vor dem Senden an Claude herunter, um einen Anstieg der Token-Nutzung zu vermeiden. Siehe Bilder und Vision.

  6. Automatische Fallbacks in Betracht ziehen: Claude Opus 5 wird mit Cybersicherheits-Klassifikatoren ausgeliefert, deren Ablehnungen in der Cyber-Kategorie auf Claude Opus 4.8 zurückfallen können. Um abgelehnte Anfragen automatisch auf einem anderen Modell erneut auszuführen, ziehe den fallbacks-Parameter mit dem Modus "default" (fallbacks: "default") in Betracht, der basierend auf der Ablehnungskategorie ein empfohlenes Fallback-Modell auswählt, anstatt einer manuell gepflegten Modellliste. Serverseitiges Fallback ist in der Beta; der Modus "default" erfordert den Beta-Header server-side-fallback-2026-07-01. Siehe Ablehnungen und Fallback.

  7. Kürzere Prompts cachen: Die minimale cachebare Prompt-Länge auf Claude Opus 5 beträgt 512 Token, niedriger als bei früheren Opus-Modellen. Prompts, die zu kurz zum Cachen waren, können jetzt Cache-Einträge erstellen, ohne dass Codeänderungen erforderlich sind. Siehe Prompt-Caching für die Mindestwerte pro Modell.

  8. Tools mitten im Gespräch ändern (Beta): Du kannst zwischen den Turns eines Gesprächs Tools hinzufügen oder entfernen, ohne Prompt-Cache-Treffer auf früheren Turns ungültig zu machen. Sende den Beta-Header mid-conversation-tool-changes-2026-07-01. Das ist nützlich für agentische Workloads, die Tools schrittweise bereitstellen oder sie im Verlauf einer Aufgabe zurückziehen; ohne ihn macht eine geänderte Tool-Liste das gecachte Präfix ungültig.

  9. Übernommene Verifizierungsanweisungen entfernen und Umfang einschränken: Claude Opus 5 überprüft seine eigene Arbeit, ohne dazu aufgefordert zu werden. Entferne daher ausdrückliche Verifizierungs- oder Selbstprüfungsanweisungen, die aus für frühere Modelle abgestimmten Prompts übernommen wurden; sie beizubehalten führt zu Überverifizierung. Schränke bei eng gefassten Aufgaben den Aufgabenumfang ausdrücklich ein. Siehe Aufgabenumfang und Überverifizierung.

Migrations-Checkliste

  • Aktualisiere den Modellnamen von claude-opus-4-6 auf claude-opus-5 (oder aktualisiere Aliase).
  • Entferne temperature, top_p und top_k aus den Anfrage-Payloads.
  • Ersetze thinking: {type: "enabled", budget_tokens: N} durch thinking: {type: "adaptive"} plus den Effort-Parameter, oder entferne das thinking-Feld vollständig; adaptives Denken ist auf Claude Opus 5 standardmäßig aktiviert.
  • Überprüfe Workloads, die ohne thinking-Feld liefen: Sie laufen auf Claude Opus 5 mit Denken. Überprüfe max_tokens, das ein hartes Limit für die gesamte Ausgabe (Denken plus Antworttext) bleibt, oder übergib thinking: {type: "disabled"} bei Effort high oder darunter, um das alte Verhalten beizubehalten.
  • Aktualisiere Antwort-Parsing, das Inhalte nach Position liest, etwa content[0].text oder einen Stream-Handler, der annimmt, dass der erste Inhaltsblock Text ist: Bei aktiviertem Denken kommen thinking-Blöcke vor text-Blöcken an. Wähle Inhaltsblöcke stattdessen nach type aus.
  • Wenn du eine Tool-Nutzungs-Schleife betreibst, gib thinking-Blöcke vollständig und unverändert zurück, wenn du Tool-Ergebnisse zurückgibst; veränderte Blöcke geben einen 400-Fehler zurück. Siehe Thinking-Blöcke bewahren.
  • Prüfe Anfragen, die das Denken deaktivieren: thinking: {type: "disabled"} mit Effort xhigh oder max gibt einen 400-Fehler zurück, was bei jeder Anfrage durchgesetzt wird. Aktiviere das Denken wieder oder senke den Effort auf high oder darunter.
  • Entferne alle Prefills von Assistant-Nachrichten.
  • Wenn deine UI Denkinhalte anzeigt, entscheide dich ausdrücklich für die Thinking-Zusammenfassung.
  • Führe ein neues End-to-End-Benchmarking von Kosten und Latenz unter der aktualisierten Tokenisierung durch; Denk-Token werden als Ausgabe-Token abgerechnet, sodass Workloads, die ohne Denken liefen, ebenfalls mehr Ausgabe-Token pro Anfrage erzeugen können.
  • Stimme max_tokens neu ab, um die aktualisierte Tokenisierung zu berücksichtigen.
  • Teste alle clientseitigen Token-Zählungsschätzungen neu.
  • Wenn deine Anwendung Bilder sendet, plane das Budget für die Unterstützung hochauflösender Bilder neu (bis zu etwa 3x mehr Bild-Token pro Bild in voller Auflösung). Skaliere vor dem Senden herunter, wenn du die zusätzliche Detailtreue nicht benötigst.
  • Wenn du Zeige- oder Bounding-Box-Koordinaten vom Modell verarbeitest, entferne jede Skalierungsfaktor-Umrechnung; Koordinaten entsprechen auf Claude Opus 4.7 und späteren Modellen 1:1 den tatsächlichen Bildpixeln.
  • Überprüfe Prompts auf die Verhaltensänderungen (Antwortlänge, Wörtlichkeit, Ton, Fortschrittsupdates, Subagenten, Effort-Kalibrierung, Tool-Auslösung, Cyber-Schutzmaßnahmen, Umgang mit hochauflösenden Bildern).
  • Ermittle eine neue Baseline für die Antwortlänge, nachdem bestehende Längensteuerungs-Prompts entfernt wurden, und stimme dann ausdrücklich ab.
  • Wenn du Effort xhigh oder max verwendest, erhöhe max_tokens als Ausgangspunkt auf mindestens 64k.
  • Ziehe die Einführung von Task-Budgets (Beta) und Tool-Änderungen mitten im Gespräch (Beta) für agentische Workflows in Betracht.
  • Behandle stop_reason: "refusal" und ziehe fallbacks: "default" (Beta) in Betracht, um abgelehnte Anfragen automatisch auf einem empfohlenen Fallback-Modell erneut auszuführen.
  • Überprüfe Prompts nahe dem Caching-Minimum: Prompts mit 512 Token oder mehr können jetzt auf Claude Opus 5 Cache-Einträge erstellen.
  • Wenn du Web Fetch verwendest, plane eine Alternative: Es ist auf Claude Opus 5 nicht verfügbar.
  • Wenn deine Organisation eine Priority Tier-Verpflichtung hat, beachte, dass Priority Tier auf Claude Opus 5 nicht unterstützt wird.
  • Entferne Verifizierungs- und Selbstprüfungsanweisungen, die aus für frühere Modelle abgestimmten Prompts übernommen wurden; sie verursachen auf Claude Opus 5 Überverifizierung.
  • Wenn dein Produkt legitime Sicherheitsarbeit leistet, bewirb dich beim Cyber Verification Program für Zugang zu geringeren Einschränkungen bei Cyber-Inhalten.

Migration von Claude Opus 4.5 oder früher

Wenn du von Claude Opus 4.5, Opus 4.1 oder einem früheren Modell direkt zu Claude Opus 5 migrierst, wende alle Änderungen weiter oben in diesem Abschnitt an, plus die folgenden kumulativen Änderungen, die zwischen Opus 4.5 und Opus 4.7 in Kraft getreten sind. Wenn du von Opus 4.6 migrierst, sind die Änderungen weiter oben in diesem Abschnitt alles, was du brauchst.

Aktualisiere deinen Modellnamen

# Opus-Migration
model = "claude-opus-4-5"  # Before
model = "claude-opus-5"  # After

Breaking Changes

  1. Prefill-Entfernung wird in den Breaking Changes für die Migration von Claude Opus 4.6 behandelt.

  2. Quoting von Tool-Parametern: Claude Opus 4.6 und spätere Modelle können leicht unterschiedliches JSON-String-Escaping in Tool-Aufruf-Argumenten erzeugen (zum Beispiel unterschiedliche Behandlung von Unicode-Escapes oder Escaping von Schrägstrichen). Wenn du den input von Tool-Aufrufen als rohen String parst, anstatt einen JSON-Parser zu verwenden, überprüfe deine Parsing-Logik. Standard-JSON-Parser (wie json.loads() oder JSON.parse()) behandeln diese Unterschiede automatisch.

Diese Änderungen verbessern deine Erfahrung auf Claude Opus 4.7 und späteren Modellen. Mit (erforderlich auf Opus 4.7) markierte Punkte waren beim Start von Opus 4.6 optionale Empfehlungen, sind jetzt aber verpflichtend; der Rest bleibt empfohlen.

  1. Zu adaptivem Denken migrieren (erforderlich auf Opus 4.7): thinking: {type: "enabled", budget_tokens: N} gibt auf Claude Opus 4.7 und späteren Modellen einen 400-Fehler zurück. Wechsle zu thinking: {type: "adaptive"} und verwende den Effort-Parameter, um die Denktiefe zu steuern; auf Claude Opus 5 entspricht thinking: {type: "adaptive"} dem Weglassen des thinking-Felds, was standardmäßig mit adaptivem Denken läuft. Siehe Denken.

    response = client.beta.messages.create(
        model="claude-opus-4-5",
        max_tokens=16000,
        thinking={"type": "enabled", "budget_tokens": 32000},
        betas=["interleaved-thinking-2025-05-14"],
        messages=[{"role": "user", "content": "Your prompt here"}],
    )

    Beachte, dass die Migration auch von client.beta.messages.create zu client.messages.create wechselt. Adaptives Denken und Effort erfordern weder den Beta-SDK-Namespace noch irgendwelche Beta-Header.

  2. Effort-Beta-Header entfernen: Der Effort-Parameter erfordert keinen Beta-Header. Entferne betas=["effort-2025-11-24"] aus deinen Anfragen.

  3. Beta-Header für feingranulares Tool-Streaming entfernen: Feingranulares Tool-Streaming erfordert keinen Beta-Header. Entferne betas=["fine-grained-tool-streaming-2025-05-14"] aus deinen Anfragen.

  4. Beta-Header für Interleaved Thinking entfernen: Adaptives Denken aktiviert Interleaved Thinking auf Claude Opus 4.7, Opus 4.6 und Sonnet 4.6 automatisch. Entferne betas=["interleaved-thinking-2025-05-14"] aus deinen Anfragen. Der Header ist auf Sonnet 4.6 mit manuellem erweitertem Denken weiterhin funktionsfähig, aber der manuelle Modus ist abgekündigt.

  5. Zu output_config.format migrieren: Wenn du strukturierte Ausgaben verwendest, aktualisiere output_format={...} auf output_config={"format": {...}}. Die API akzeptiert den abgekündigten Parameter output_format weiterhin, aber er wird in einem zukünftigen Modell-Release entfernt. Das Python SDK (v1.0 und später) akzeptiert output_format={...} nicht auf client.beta.messages.create() oder count_tokens(). Das Argument output_format=Model der Helfer parse() und stream() ist unverändert.

Migration von Claude 4.1 oder früher

Wenn du von Opus 4.1 oder früheren Modellen direkt zu Claude Opus 5 migrierst, wende alle Änderungen weiter oben in diesem Abschnitt an, plus die zusätzlichen Änderungen in diesem Unterabschnitt.

# Von Opus 4.1
model = "claude-opus-4-1-20250805"  # Before
model = "claude-opus-5"  # After

# Von Sonnet 3.7
model = "claude-3-7-sonnet-20250219"  # Before
model = "claude-opus-5"  # After

Zusätzliche Breaking Changes

  1. Sampling-Parameter entfernen

    Ab Claude Opus 4.7 gibt das Setzen von temperature, top_p oder top_k auf einen beliebigen Nicht-Standardwert einen 400-Fehler zurück. Das Python SDK (v1.0 und später) definiert sie nicht, und ihre Übergabe löst einen TypeError aus. Der sicherste Migrationspfad ist, diese Parameter vollständig aus Anfragen wegzulassen und Prompting zu verwenden, um das Verhalten des Modells zu steuern. Falls du temperature = 0 für Determinismus verwendet hast, beachte, dass dies nie identische Ausgaben garantiert hat.

    # Vorher – Dies führt bei Claude-4+-Modellen zu einem Fehler
    response = client.messages.create(
        model="claude-3-7-sonnet-20250219",
        temperature=0.7,
        top_p=0.9,  # Non-default sampling params return 400 on Opus 4.7
        # ...
    )
    
    # Nachher
    response = client.messages.create(
        model="claude-opus-5",
        # ...
    )
  2. Tool-Versionen aktualisieren

    Aktualisiere auf die neuesten Tool-Versionen. Entferne jeglichen Code, der den Befehl undo_edit verwendet.

    # Vorher
    tools = [{"type": "text_editor_20250124", "name": "str_replace_editor"}]
    
    # Nachher
    tools = [{"type": "text_editor_20250728", "name": "str_replace_based_edit_tool"}]
    • Texteditor: Verwende text_editor_20250728 und str_replace_based_edit_tool. Siehe die Dokumentation zum Texteditor-Tool für Details.
    • Code-Ausführung: Aktualisiere auf code_execution_20260521. Siehe die Dokumentation zum Code-Ausführungs-Tool für Migrationsanweisungen.
  3. Den Stop-Reason refusal behandeln

    Aktualisiere deine Anwendung, um refusal-Stop-Reasons zu behandeln:

    response = client.messages.create(...)
    
    if response.stop_reason == "refusal":
        # Ablehnung angemessen behandeln
        pass
  4. Den Stop-Reason model_context_window_exceeded behandeln

    Claude 4.5+-Modelle geben den Stop-Reason model_context_window_exceeded zurück, wenn die Generierung stoppt, weil das Limit des Kontextfensters erreicht wurde, und nicht das angeforderte max_tokens-Limit. Aktualisiere deine Anwendung, um diesen neuen Stop-Reason zu behandeln:

    response = client.messages.create(...)
    
    if response.stop_reason == "model_context_window_exceeded":
        # Kontextfenster-Limit angemessen behandeln
        pass
  5. Behandlung von Tool-Parametern überprüfen (abschließende Zeilenumbrüche)

    Claude 4.5+-Modelle bewahren abschließende Zeilenumbrüche in String-Parametern von Tool-Aufrufen, die zuvor entfernt wurden. Wenn deine Tools auf exaktes String-Matching gegen Tool-Aufruf-Parameter angewiesen sind, überprüfe, ob deine Logik abschließende Zeilenumbrüche korrekt behandelt.

  6. Deine Prompts für Verhaltensänderungen aktualisieren

    Claude 4+-Modelle haben einen prägnanteren, direkteren Kommunikationsstil und erfordern ausdrückliche Anleitung. Lies die Best Practices für Prompting für Optimierungshinweise.

  • Veraltete Beta-Header entfernen: Entferne token-efficient-tools-2025-02-19 und output-128k-2025-02-19. Alle Claude 4+-Modelle haben eingebaute token-effiziente Tool-Nutzung, und diese Header haben keine Wirkung.

Migrations-Checkliste (von Claude Opus 4.5 oder früher)

  • Aktualisiere die Modell-ID auf claude-opus-5
  • Wende alle Breaking Changes für die Migration von Claude Opus 4.6 an (erweitertes Denken entfernt, Denken standardmäßig aktiviert, Effort-Obergrenze beim Deaktivieren des Denkens, Sampling-Parameter entfernt, Anzeige des Denkens standardmäßig ausgelassen, aktualisierte Tokenisierung)
  • BREAKING: Entferne Prefills von Assistant-Nachrichten (gibt einen 400-Fehler zurück); verwende stattdessen strukturierte Ausgaben oder output_config.format
  • BREAKING auf Opus 4.7: Ersetze thinking: {type: "enabled", budget_tokens: N} durch thinking: {type: "adaptive"} plus den Effort-Parameter (gibt auf Opus 4.7 einen 400-Fehler zurück)
  • Stelle sicher, dass das JSON-Parsing von Tool-Aufrufen einen Standard-JSON-Parser verwendet
  • Entferne den Beta-Header effort-2025-11-24 (der Effort-Parameter benötigt ihn nicht)
  • Entferne den Beta-Header fine-grained-tool-streaming-2025-05-14
  • Entferne den Beta-Header interleaved-thinking-2025-05-14 (adaptives Denken aktiviert verschachteltes Denken automatisch)
  • Migriere output_format zu output_config.format (falls zutreffend)
  • Bei Migration von Claude 4.1 oder früher: Entferne temperature, top_p und top_k (Nicht-Standardwerte geben auf Opus 4.7 einen 400-Fehler zurück)
  • Bei Migration von Claude 4.1 oder früher: Aktualisiere die Tool-Versionen (text_editor_20250728, code_execution_20260521)
  • Bei Migration von Claude 4.1 oder früher: Behandle den Stop-Reason refusal
  • Bei Migration von Claude 4.1 oder früher: Behandle den Stop-Reason model_context_window_exceeded
  • Bei Migration von Claude 4.1 oder früher: Überprüfe die Behandlung von Tool-String-Parametern hinsichtlich nachgestellter Zeilenumbrüche
  • Bei Migration von Claude 4.1 oder früher: Entferne veraltete Beta-Header (token-efficient-tools-2025-02-19, output-128k-2025-02-19)
  • Überprüfe und aktualisiere Prompts gemäß den Best Practices für das Prompting
  • Teste in einer Entwicklungsumgebung vor dem Produktions-Deployment

Migration zu Claude Opus 5 von Claude Sonnet 5

Claude Opus 5 und Claude Sonnet 5 teilen dieselbe API-Oberfläche: Beide laufen standardmäßig mit aktiviertem adaptivem Denken, beide setzen den Effort-Parameter auf der Claude API und in Claude Code standardmäßig auf high, beide stellen standardmäßig ein „context window“ (Kontextfenster) von 1 Mio. Token mit 128k maximalen Ausgabe-Token bereit, und keines der beiden unterstützt Priority Tier. Manuelles erweitertes Denken und Nicht-Standard-Sampling-Parameter geben auf beiden Modellen einen 400-Fehler zurück, ebenso wie Assistant-Prefill.

Aktualisiere deinen Modellnamen

model = "claude-sonnet-5"  # Before
model = "claude-opus-5"  # After

Was sich geändert hat

  1. Preise: Claude Opus 5 kostet 5 $ pro Million Eingabe-Token und 25 $ pro Million Ausgabe-Token. Claude Sonnet 5 kostet 2 $ / 10 $ pro Million Eingabe-/Ausgabe-Token. Siehe Claude-Preise für die vollständige Preisübersicht.

  2. Das Deaktivieren des Denkens ist auf Effort high begrenzt: Auf Claude Sonnet 5 wird thinking: {type: "disabled"} bei jedem Effort-Level akzeptiert. Auf Claude Opus 5 wird es nur bei einem Effort-Level von high oder darunter akzeptiert; eine Anfrage, die thinking: {type: "disabled"} mit Effort xhigh oder max kombiniert, gibt einen 400-Fehler zurück, was bei jeder Anfrage durchgesetzt wird. Prüfe Anfragen, die das Denken deaktivieren, bevor du migrierst.

  3. System-Nachrichten mitten im Gespräch: Claude Opus 5 akzeptiert Nachrichten mit role: "system" unmittelbar nach einem User-Turn im messages-Array (vorbehaltlich der Platzierungsregeln). Diese Funktion ist auf Claude Sonnet 5 nicht verfügbar. Wenn du Codepfade pflegst, die den vollständigen Nachrichtenverlauf neu aufbauen, um Anweisungen zu aktualisieren, kannst du sie vereinfachen und Prompt-Cache-Treffer bei früheren Turns erhalten.

  4. Web Fetch ist nicht verfügbar: Das Web-Fetch-Tool ist auf Claude Sonnet 5 verfügbar, aber nicht auf Claude Opus 5.

Migrations-Checkliste

  • Aktualisiere den Modellnamen von claude-sonnet-5 auf claude-opus-5.
  • Prüfe Anfragen, die das Denken deaktivieren: thinking: {type: "disabled"} mit Effort xhigh oder max gibt auf Claude Opus 5 einen 400-Fehler zurück. Aktiviere das Denken wieder oder senke den Effort auf high oder darunter.
  • Wenn du Web Fetch verwendest, plane eine Alternative: Es ist auf Claude Opus 5 nicht verfügbar.
  • Führe die Token-Zählung erneut gegen Claude Opus 5 aus, anstatt gegen Claude Sonnet 5 gemessene Zählungen wiederzuverwenden, und erstelle eine neue Baseline für Kosten und Latenz auf deinen eigenen Workloads; die Preise pro Token unterscheiden sich.

Was this page helpful?