Effort
Steuere mit dem effort-Parameter, wie viele Token Claude beim Antworten verwendet, und wäge dabei zwischen Gründlichkeit der Antwort und Token-Effizienz ab.
Mit dem „effort“-Parameter (Aufwand) kannst du steuern, wie viele Token Claude beim Beantworten von Anfragen aufwendet. Du kannst mit einem einzigen Modell zwischen Gründlichkeit der Antwort und Token-Effizienz abwägen. Der effort-Parameter auf oberster Ebene ist auf allen unterstützten Modellen verfügbar, ohne dass ein Beta-Header erforderlich ist. Effort pro Nachricht befindet sich in der Beta-Phase.
Das Effort-Level festlegen
Setze output_config.effort in der Anfrage. Das folgende Beispiel führt eine Anfrage mit medium-Effort aus und gibt den Antworttext aus.
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-opus-5-5",
max_tokens=4096,
messages=[
{
"role": "user",
"content": "Analyze the trade-offs between microservices and monolithic architectures",
}
],
output_config={"effort": "medium"},
)
for block in response.content:
if block.type == "text":
print(block.text)Wie Effort funktioniert
Die meisten Claude-Modelle verwenden standardmäßig hohen Effort und wenden so viele Token auf, wie für hervorragende Ergebnisse nötig sind; Claude Opus 5.5 und Claude Haiku 5.5 verwenden standardmäßig mittleren Effort. Du kannst das Effort-Level auf max erhöhen, um die absolut höchste Leistungsfähigkeit zu erhalten, oder es senken, um sparsamer mit Token umzugehen und so Geschwindigkeit und Kosten zu optimieren, wobei du eine gewisse Einbuße an Leistungsfähigkeit in Kauf nimmst.
Der Effort-Parameter wirkt sich auf alle Token in der Antwort aus, einschließlich:
- Textantworten und Erklärungen
- Tool-Aufrufe und Funktionsargumente
- Nachdenken (wenn aktiv)
Da Effort für jedes Ausgabe-Token gilt, funktioniert er unabhängig davon, ob Nachdenken aktiviert ist oder nicht. Niedrigerer Effort bedeutet außerdem weniger und knappere Tool-Aufrufe.
Effort-Level
| Level | Beschreibung | Typischer Anwendungsfall |
|---|---|---|
max | Absolut maximale Leistungsfähigkeit ohne Einschränkungen beim Token-Verbrauch. Verfügbar auf Claude Fable 5.1, Claude Mythos 5.1, Claude Fable 5, Claude Mythos 5, Claude Mythos Preview, Claude Opus 5.5, Claude Opus 5, Claude Opus 4.8, Claude Opus 4.7, Claude Opus 4.6, Claude Sonnet 5.5, Claude Sonnet 5, Claude Sonnet 4.6 und Claude Haiku 5.5. | Aufgaben, die das tiefstmögliche Schlussfolgern und die gründlichste Analyse erfordern |
xhigh | Erweiterte Leistungsfähigkeit für Arbeit mit langem Zeithorizont. Verfügbar auf Claude Fable 5.1, Claude Mythos 5.1, Claude Fable 5, Claude Mythos 5, Claude Opus 5.5, Claude Opus 5, Claude Opus 4.8, Claude Opus 4.7, Claude Sonnet 5.5, Claude Sonnet 5 und Claude Haiku 5.5. | Lang laufende agentische und Coding-Aufgaben (über 30 Minuten) mit Token-Budgets in Millionenhöhe |
high | Wendet so viele Token auf, wie die Aufgabe für hervorragende Ergebnisse benötigt. Der Standard auf jedem Modell, das Effort unterstützt, außer Claude Opus 5.5 und Claude Haiku 5.5. | Komplexes Schlussfolgern, schwierige Coding-Probleme, agentische Aufgaben |
medium | Ausgewogener Ansatz mit moderaten Token-Einsparungen. Der Standard auf Claude Opus 5.5 und Claude Haiku 5.5. | Agentische Aufgaben, die ein Gleichgewicht aus Geschwindigkeit, Kosten und Leistung erfordern |
low | Am effizientesten. Erhebliche Token-Einsparungen bei gewisser Einbuße an Leistungsfähigkeit. | Einfachere Aufgaben, die die beste Geschwindigkeit und die niedrigsten Kosten benötigen, etwa Subagenten |
Nicht jedes Modell, das max unterstützt, unterstützt auch xhigh.
Die folgenden modellspezifischen Empfehlungen haben Vorrang vor dieser Tabelle, wo sie davon abweichen.
Empfohlene Effort-Level für Claude Fable 5.1
Claude Fable 5.1 unterstützt alle fünf Effort-Level. Beginne mit high, dem Standard. Gehe für die leistungssensibelsten agentischen und Coding-Arbeiten auf xhigh oder max hoch und für Routine- oder latenzsensible Arbeiten auf medium oder low herunter, sobald deine Evals zeigen, dass die Qualität erhalten bleibt. Setze bei high und darüber ein großes max_tokens. Es ist ein hartes Limit für die gesamte Ausgabe (Nachdenken plus Antworttext). Dieselben Empfehlungen gelten für Claude Mythos 5.1. Siehe Prompting für Claude Fable 5.1.
Claude Fable 5.1 unterstützt außerdem das Ändern des Efforts mitten im Gespräch mit einer output_config pro Nachricht, wodurch der Prompt-Cache erhalten bleibt.
Empfohlene Effort-Level für Claude Fable 5
Effort ist die primäre Steuerung, um auf Claude Fable 5 zwischen Intelligenz, Latenz und Kosten abzuwägen. Beginne für die meisten Aufgaben mit high, dem Standard, verwende xhigh für die leistungssensibelsten Workloads und gehe für Routinearbeiten auf medium oder low herunter. Niedrigere Effort-Einstellungen auf Claude Fable 5 liefern immer noch gute Leistung und übertreffen häufig die xhigh-Leistung früherer Modelle. Setze bei high und xhigh ein großes max_tokens. Es ist ein hartes Limit für die gesamte Ausgabe (Nachdenken plus Antworttext). Siehe Kostenkontrolle.
Reduziere den Effort, wenn eine Aufgabe zwar abgeschlossen wird, aber länger dauert als nötig, oder wenn du einen schnelleren, interaktiveren Arbeitsstil möchtest. Dieselben Empfehlungen gelten für Claude Mythos 5. Ausführlichere Hinweise findest du unter Prompting für Claude Fable 5.
Empfohlene Effort-Level für Claude Opus 5.5
Claude Opus 5.5 unterstützt alle fünf Effort-Level, und medium ist der Standard (Claude Opus 5 und frühere Opus-Modelle verwenden standardmäßig high, sodass eine Anfrage, die effort weglässt, eine Stufe niedriger läuft als bei Claude Opus 5). Adaptives Nachdenken ist immer aktiv und kann nicht deaktiviert werden, daher ist Effort die primäre Steuerung dafür, wie viel das Modell nachdenkt und was eine Anfrage kostet. Führe einen Effort-Sweep mit deinen eigenen Evals durch, anstatt Einstellungen von einem früheren Modell zu übernehmen, und setze bei den höheren Levels einen großen Wert für max_tokens: Er ist eine harte Obergrenze für die gesamte Ausgabe (Nachdenken plus Antworttext). Anfragen, die thinking: {"type": "disabled"} setzen, geben auf jedem Effort-Level einen 400-Fehler zurück. Claude Opus 5.5 unterstützt außerdem das Ändern des Efforts mitten im Gespräch mit einer output_config pro Nachricht, wodurch der Prompt-Cache erhalten bleibt. Siehe Prompting für Claude Opus 5.5.
Empfohlene Effort-Level für Claude Opus 5
Claude Opus 5 unterstützt alle fünf Effort-Level. Beginne mit high, dem Standard, und passe ihn anhand deiner Evals an: Wechsle zu xhigh für anspruchsvolle Coding- und agentische Arbeit oder zu max, wenn eine Aufgabe uneingeschränkten Token-Verbrauch rechtfertigt, und verwende low und medium großzügig als deine wichtigste Steuerung für Token-Kosten und Antwortzeit, wo immer deine Evals zeigen, dass die Qualität erhalten bleibt. Wenn du Effort-Einstellungen von einem früheren Modell übernommen hast, führe einen neuen Effort-Sweep mit deinen Evals durch, anstatt sie wiederzuverwenden.
Effort steuert den Umfang des Nachdenkens, nicht die Länge der sichtbaren Antwort: Bei Claude Opus 5 verkürzt eine Änderung des Efforts die Antworten nicht zuverlässig, daher solltest du stattdessen die Länge per Prompt vorgeben.
Der API-Standard ist high. Setze effort explizit, um ein anderes Level zu verwenden. Der übergebene Wert überschreibt den Standard.
Bei Claude Opus 5 kann das Nachdenken bei Effort xhigh oder max nicht deaktiviert werden: Anfragen, die auf diesen Levels thinking: {"type": "disabled"} setzen, geben einen 400-Fehler zurück. Siehe Effort mit Nachdenken.
Wenn du Claude Opus 5 mit Effort xhigh oder max ausführst, setze einen großen Wert für max_tokens, damit das Modell genug Spielraum hat, um über Subagenten und Tool-Aufrufe hinweg nachzudenken und zu handeln. Mit 64k Token zu beginnen und von dort aus nachzujustieren, ist ein sinnvoller Standard.
Claude Opus 5 unterstützt außerdem das Ändern des Efforts mitten im Gespräch mit einer output_config pro Nachricht, wodurch der Prompt-Cache erhalten bleibt. Effort pro Nachricht ist für Claude Opus 5 auf Amazon Bedrock nicht verfügbar.
Empfohlene Effort-Level für Claude Opus 4.8
Die Hinweise für Claude Opus 4.7 gelten auch für Claude Opus 4.8. Beginne mit xhigh für Coding- und agentische Anwendungsfälle, verwende high für die meisten anderen intelligenzsensiblen Workloads und gehe nur dann auf medium oder low herunter, wenn du gemessen hast, dass das niedrigere Level die Qualität auf deinen Evals hält.
Der API-Standard ist high. Setze effort explizit, um ein anderes Level zu verwenden. Der übergebene Wert überschreibt den Standard.
Wenn du Claude Opus 4.8 mit xhigh- oder max-Effort betreibst, setze ein großes max_tokens, damit das Modell Raum hat, über Subagenten und Tool-Aufrufe hinweg zu denken und zu handeln. Mit 64k Token zu beginnen und von dort aus abzustimmen, ist ein vernünftiger Standard.
Empfohlene Effort-Level für Claude Opus 4.7
Beginne für Coding- und agentische Anwendungsfälle mit xhigh und verwende high als Minimum für die meisten intelligenzkritischen Workloads. Gehe für kostensensible Workloads auf medium herunter oder nur dann auf max hoch, wenn deine Evals messbaren Spielraum bei xhigh zeigen.
Der API-Standard ist high. Um xhigh zu verwenden, setze effort explizit. Der übergebene Wert überschreibt den Standard.
| Effort | Hinweise für Claude Opus 4.7 |
|---|---|
low | Effizient, aber am besten für kurze, klar abgegrenzte Aufgaben. Kombiniere low mit expliziten Checklisten, wenn deine Aufgabe mehrere Abschnitte hat. |
medium | Der direkte Ersatz für den durchschnittlichen Workflow, bei dem du gute Ergebnisse bei geringeren Kosten möchtest. |
high | Fortgeschrittene Anwendungsfälle, die dennoch ein Gleichgewicht zwischen Intelligenz und Token-Verbrauch benötigen. Dies ist oft das beste Gleichgewicht zwischen Qualität und Token-Effizienz. |
xhigh | Der empfohlene Ausgangspunkt für Coding- und agentische Arbeit sowie für explorative Aufgaben wie wiederholte Tool-Aufrufe, detaillierte Websuche und Wissensdatenbanksuche. Rechne mit deutlich höherem Token-Verbrauch als bei high. |
max | Reserviere es für Probleme an der Leistungsgrenze. Bei den meisten Workloads verursacht max erhebliche Mehrkosten für relativ geringe Qualitätsgewinne, und bei manchen Aufgaben mit strukturierter Ausgabe oder geringerer Intelligenzanforderung kann es zu übermäßigem Nachdenken führen. |
Claude Opus 4.7 hält sich außerdem strenger an Effort-Level als Claude Opus 4.6, insbesondere bei low und medium. Bei niedrigeren Effort-Levels beschränkt das Modell seine Arbeit auf das, was verlangt wurde, anstatt mehr als angefordert zu tun. Wenn du bei Claude Opus 4.7 oberflächliches Schlussfolgern bei komplexen Problemen beobachtest, erhöhe den Effort, anstatt das Problem per Prompt zu umgehen. Wenn du den Effort aus Latenzgründen niedrig halten musst, füge gezielte Hinweise hinzu wie „Diese Aufgabe erfordert mehrstufiges Schlussfolgern. Denke sorgfältig nach, bevor du antwortest.“
Wenn du Claude Opus 4.7 mit Effort xhigh oder max ausführst, setze einen großen Wert für max_tokens, damit das Modell genug Spielraum hat, um über Subagenten und Tool-Aufrufe hinweg nachzudenken und zu handeln. Mit 64k Token zu beginnen und von dort aus nachzujustieren, ist ein sinnvoller Standard.
Empfohlene Effort-Level für Claude Sonnet 5.5
Claude Sonnet 5.5 unterstützt alle fünf Effort-Level, und high ist der Standard in der Claude API. Seine Level sind neu kalibriert, sodass ein Level nicht dieselbe Menge an Nachdenken erzeugt wie dasselbe Level bei Claude Sonnet 5. Führe einen neuen Effort-Sweep mit deinen Evals durch, anstatt die Einstellung zu übernehmen, die du bei Claude Sonnet 5 verwendet hast. Beginne mit high, es sei denn, dein Workload ist agentisch oder latenzkritisch. Für agentisches Coding und mehrstufige Tool-Nutzung beginne bei klar spezifizierten Aufgaben mit medium und wechsle bei schwierigeren oder längeren Aufgaben zu high. Für Chat und andere latenzkritische Arbeit beginne mit medium oder low. Verwende xhigh oder max nur dort, wo deine Evals einen Qualitätsgewinn zeigen. Setze max_tokens mit genug Spielraum für Nachdenken und Antwort. Nachdenken zählt zu max_tokens, auch wenn der Inhalt des Nachdenkens nicht zurückgegeben wird. Für agentisches Coding setze max_tokens auf 128.000, das Maximum des Modells, und verwende Streaming für die Antwort.
Um das vorgelagerte Nachdenken auszuschalten, sende thinking: {"type": "between_tools"} statt "disabled". Das ist die niedrigste Nachdenk-Einstellung bei Claude Sonnet 5.5, und sie funktioniert bei Effort low, medium und high. Bei xhigh oder max gibt eine Anfrage damit einen 400-Fehler zurück, verwende auf diesen Levels daher adaptives Nachdenken: Lass das Feld thinking weg oder sende thinking: {"type": "adaptive"}. Siehe Ausführung ohne vorgelagertes Nachdenken.
Claude Sonnet 5.5 unterstützt außerdem das Ändern des Efforts mitten im Gespräch mit einer output_config pro Nachricht, wodurch der Prompt-Cache erhalten bleibt. Mit between_tools kann sich der Effort nicht mitten im Gespräch ändern: Ein output_config.effort pro Nachricht, das vom aktuell geltenden Level abweicht, gibt einen 400-Fehler zurück. Um den Effort pro Turn zu variieren, verwende adaptives Nachdenken. Siehe Prompting für Claude Sonnet 5.5.
Empfohlene Effort-Level für Claude Sonnet 5
Claude Sonnet 5 verwendet auf der Claude API und in Claude Code standardmäßig high-Effort.
- High-Effort (Standard): Geeignet für komplexes Schlussfolgern, Coding und agentische Aufgaben, bei denen Qualität wichtiger ist als Geschwindigkeit oder Kosten.
- Xhigh-Effort: Für die schwierigsten Coding- und agentischen Aufgaben. Siehe Prompting für Claude Sonnet 5.
- Medium-Effort: Kostensparende Stufe unterhalb des Standards. Vergleichbar mit Claude Sonnet 4.6 bei High-Effort.
- Low-Effort: Für Workloads mit hohem Volumen oder Latenzsensibilität. Geeignet für Chat- und Nicht-Coding-Anwendungsfälle, bei denen schnellere Bearbeitung Priorität hat.
- Max-Effort: Für Aufgaben, die die absolut höchste Leistungsfähigkeit ohne Einschränkungen beim Token-Verbrauch erfordern.
Empfohlene Effort-Level für Claude Sonnet 4.6
Sonnet 4.6 verwendet standardmäßig Effort high. Setze den Effort bei der Verwendung von Sonnet 4.6 explizit, um unerwartete Latenz zu vermeiden:
- Medium-Effort (empfohlener Standard): Bestes Gleichgewicht aus Geschwindigkeit, Kosten und Leistung für die meisten Anwendungen. Geeignet für agentisches Coding, Tool-intensive Workflows und Codegenerierung.
- Low-Effort: Für Workloads mit hohem Volumen oder Latenzsensibilität. Geeignet für Chat- und Nicht-Coding-Anwendungsfälle, bei denen schnellere Bearbeitung Priorität hat.
- High-Effort: Für komplexes Schlussfolgern und Aufgaben, bei denen Qualität wichtiger ist als Geschwindigkeit oder Kosten.
- Max-Effort: Für Aufgaben, die die absolut höchste Leistungsfähigkeit ohne Einschränkungen beim Token-Verbrauch erfordern.
Empfohlene Effort-Level für Claude Haiku 5.5
Claude Haiku 5.5 unterstützt alle fünf Effort-Level, und medium ist der Standard in der Claude API und in Claude Code. Effort ist die wichtigste Steuerung dafür, wie viel das Modell nachdenkt, und damit für Qualität, Latenz und Kosten. Beginne für die meisten Aufgaben mit medium, einschließlich agentischem Coding. Verwende low, das günstigste und schnellste Level, für Chat, kurze Tool-Aufgaben und einfache Anfragen mit hohem Volumen. Bei langen Agenten-Prompts ist es bei low wahrscheinlicher, dass das Modell eine Suche auslässt, früh aufhört oder eine Prüfung überspringt. Verwende high für Wissensarbeit, längere Agentenaufgaben und striktes Befolgen von Anweisungen. Verwende xhigh oder max nur dort, wo deine Evals einen Qualitätsgewinn zeigen, und vergleiche sie hinsichtlich Leistung, Kosten und Geschwindigkeit mit Claude Sonnet 5.5. Nachdenken ist standardmäßig aktiviert und zählt zu max_tokens, lass also Spielraum dafür. Siehe Prompting für Claude Haiku 5.5.
Um weniger Nachdenken zu erhalten, senke das Effort-Level. Du kannst bei Effort high oder darunter auch thinking: {"type": "disabled"} senden. Bei xhigh oder max gibt dies einen 400-Fehler zurück, verwende dort daher adaptives Nachdenken: Lass das Feld thinking weg oder sende thinking: {"type": "adaptive"}.
In der Claude API und auf Google Cloud unterstützt Claude Haiku 5.5 außerdem das Ändern des Efforts mitten im Gespräch mit einer output_config pro Nachricht, wodurch der Prompt-Cache erhalten bleibt. Mit thinking: {"type": "disabled"} kann sich der Effort nicht mitten im Gespräch ändern: Ein output_config.effort pro Nachricht, das vom aktuell geltenden Level abweicht, gibt einen 400-Fehler zurück. Um den Effort pro Turn zu variieren, verwende adaptives Nachdenken.
Effort mit Tool-Nutzung
Bei der „tool use“ (Tool-Nutzung) wirkt sich der effort-Parameter sowohl auf die Erklärungen rund um Tool-Aufrufe als auch auf die Tool-Aufrufe selbst aus. Niedrigere Effort-Level neigen dazu:
- Mehrere Operationen in weniger Tool-Aufrufen zusammenzufassen
- Weniger Tool-Aufrufe zu machen
- Ohne Vorrede direkt zur Aktion überzugehen
- Nach Abschluss knappe Bestätigungsnachrichten zu verwenden
Höhere Effort-Level können:
- Mehr Tool-Aufrufe machen
- Den Plan erklären, bevor sie handeln
- Detaillierte Zusammenfassungen der Änderungen liefern
- Umfassendere Code-Kommentare einfügen
Effort mit Nachdenken
Der Parameter thinking steuert, ob Claude vor dem Antworten in Thinking-Blöcken nachdenkt; der Parameter effort steuert, wie viel Arbeit Claude in die gesamte Antwort steckt, was im adaptiven Modus auch umfasst, wie oft und wie tief es nachdenkt. Übergib adaptive nicht als effort-Wert: adaptive ist ein Denkmodus, keine Effort-Stufe.
Bei höheren Effort-Stufen denkt Claude bereitwilliger und ausführlicher nach. In einer Tool-Nutzungs-Schleife können Folgeanfragen, die nur Tool-Ergebnisse verarbeiten, das Nachdenken auf jeder Stufe trotzdem überspringen. Bei niedrigeren Stufen kann Claude das Nachdenken bei einfacheren Problemen ganz überspringen. Ausführliche Hinweise dazu, wie die beiden Steuerungen zusammenwirken, findest du unter Nachdenken und Effort.
Auf Claude Opus 4.5, dem einzigen Modell mit ausschließlich erweitertem Nachdenken, das Effort unterstützt, arbeitet er zusammen mit budget_tokens: Setze das Effort-Level für deine Aufgabe und lege dann das Token-Budget für das Nachdenken danach fest, wie viel Denktiefe die Aufgabe benötigt.
Zur Verfügbarkeit des Nachdenkens pro Modell siehe die Konfigurationstabelle pro Modell. Effort funktioniert mit oder ohne Nachdenken. Siehe Wie Effort funktioniert.
Effort mitten im Gespräch ändern
Du kannst spätere Turns eines Gesprächs auf zwei Arten mit einem anderen Effort-Level ausführen. Bei Claude Fable 5.1, Claude Mythos 5.1, Claude Opus 5.5, Claude Opus 5, Claude Sonnet 5.5 und Claude Haiku 5.5 verwendest du eine Effort-Änderung pro Nachricht, wodurch der Prompt-Cache erhalten bleibt. Bei anderen Modellen setzt du in der nächsten Anfrage einen neuen Wert auf oberster Ebene, wodurch der Cache neu beginnt.
Effort pro Nachricht (Beta)
Effort pro Nachricht befindet sich in der Beta-Phase. In der Claude API und auf Google Cloud ist er auf Claude Fable 5.1, Claude Mythos 5.1, Claude Opus 5.5, Claude Opus 5, Claude Sonnet 5.5 und Claude Haiku 5.5 verfügbar. Auf Amazon Bedrock ist er auf Claude Fable 5.1, Claude Mythos 5.1 und Claude Opus 5.5 verfügbar. Er erfordert den Beta-Header mid-conversation-output-config-2026-07-01. Mit der Amazon Bedrock InvokeModel API ist er auf Claude Fable 5.1 und Claude Opus 5.5 verfügbar, und du sendest diesen Wert stattdessen im Array anthropic_beta des Request-Bodys.
Ohne den Beta-Wert gibt eine output_config pro Nachricht einen 400-Fehler zurück: messages.N.output_config: Extra inputs are not permitted, wobei N der Index der system-Nachricht in messages ist. Mit dem Beta-Wert geben Modelle ohne Effort pro Nachricht, einschließlich Claude Fable 5, einen 400-Fehler zurück: output_config.effort requires a model that supports per-turn effort; this model does not. Auf Amazon Bedrock geben diese Modelle und Claude Opus 5 stattdessen den Fehler Extra inputs are not permitted zurück. Bei Claude Sonnet 5.5 mit thinking: {"type": "between_tools"} und bei Claude Haiku 5.5 mit thinking: {"type": "disabled"} kann sich der Effort nicht mitten im Gespräch ändern: Ein output_config.effort pro Nachricht, das vom aktuell geltenden Level abweicht, gibt einen 400-Fehler zurück. Um den Effort pro Turn zu variieren, verwende adaptives Nachdenken.
Füge eine Nachricht mit role: "system", leerem content und dem neuen Level in output_config.effort hinzu. Das neue Level gilt ab dem nächsten user-Turn und bleibt bestehen, bis eine spätere Nachricht es ändert. Alles vor dieser Nachricht bleibt unverändert, sodass das gecachte Präfix weiterhin übereinstimmt.
Das folgende Beispiel beginnt mit high und wechselt dann für eine routinemäßige Folgefrage zu low:
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-fable-5-1",
max_tokens=4096,
output_config={"effort": "high"},
messages=[
{
"role": "user",
"content": "Plan a migration from SQLite to PostgreSQL in three short steps.",
},
{
"role": "assistant",
"content": "1. Export the SQLite data. 2. Create the PostgreSQL schema. 3. Import the data and verify row counts.",
},
# Reine Effort-Systemnachricht: Die neue Stufe gilt ab dem nächsten User-Turn.
{"role": "system", "content": [], "output_config": {"effort": "low"}},
{"role": "user", "content": "Summarize the plan in one sentence."},
],
betas=["mid-conversation-output-config-2026-07-01"],
)
for block in response.content:
if block.type == "text":
print(block.text)Eine System-Nachricht, die nur den Effort festlegt, enthält keinen Text, daher gelten die Platzierungsregeln für System-Nachrichten mitten im Gespräch nicht. Sie kann an beliebiger Stelle in messages stehen, auch als erster Eintrag oder zwischen einem assistant-Turn und dem nächsten user-Turn. Die Werte sind die Level-Namen (low, medium, high, xhigh und max).
Bei Claude Fable 5.1 solltest du diese Form dem Ändern des Werts auf oberster Ebene zwischen Anfragen vorziehen. Eine Änderung auf oberster Ebene startet den Cache neu und steuert das Modell außerdem weniger zuverlässig: Seine früheren Antworten wurden auf dem vorherigen Level geschrieben, und es neigt dazu, mit ihnen konsistent zu bleiben.
Effort auf oberster Ebene in der nächsten Anfrage
Das output_config.effort auf oberster Ebene gilt für die gesamte Anfrage. Um einen späteren Teil eines Gesprächs auf einem anderen Level auszuführen, setze den neuen Wert in der nächsten Anfrage. Da Effort auf oberster Ebene den gerenderten Prompt formt, bleiben gecachte Präfixe aus früheren Turns bei einer Änderung zwischen Anfragen nicht erhalten. Wenn du dich über eine lange Sitzung hinweg auf „prompt caching“ (Prompt-Caching) verlässt, siehe Prompt-Caching, und dein Modell Effort pro Nachricht nicht unterstützt, wähle zu Beginn ein Effort-Level und halte es konstant.
Best Practices
- Setze den Effort explizit: Die API verwendet standardmäßig
high(mediumbei Claude Opus 5.5 und Claude Haiku 5.5), aber der richtige Ausgangspunkt hängt von deinem Modell und deinem Workload ab. - Verwende low für geschwindigkeitskritische oder einfache Aufgaben: Wenn Latenz wichtig ist oder Aufgaben unkompliziert sind, kann niedriger Effort Antwortzeiten und Kosten erheblich reduzieren.
- Teste deinen Anwendungsfall: Die Auswirkung der Effort-Level variiert je nach Aufgabentyp. Bewerte die Leistung bei deinen spezifischen Anwendungsfällen, bevor du sie bereitstellst.
- Erwäge dynamischen Effort: Passe den Effort an die Komplexität der Aufgabe an. Einfache Anfragen rechtfertigen möglicherweise niedrigen Effort, während agentisches Coding und komplexes Schlussfolgern von hohem Effort profitieren. Lies den nächsten Punkt, bevor du ihn innerhalb eines Gesprächs variierst.
- Halte den Effort auf oberster Ebene in gecachten Gesprächen konstant: Eine Änderung des Effort-Werts auf oberster Ebene zwischen Anfragen macht das Prompt-Caching ungültig, variiere ihn daher zwischen Workloads statt innerhalb eines Gesprächs, die auf Cache-Treffer angewiesen ist. Verwende bei Modellen, die dies unterstützen, stattdessen eine Effort-Änderung pro Nachricht, wodurch der Cache erhalten bleibt. Siehe Nachdenken und Prompt-Caching.
Nächste Schritte
Gib Claude ein unverbindliches Token-Budget für die gesamte agentische Schleife, damit sich das Modell bei langen agentischen Aufgaben selbst regulieren kann.
Verstehe adaptives Nachdenken, bei dem Claude bestimmt, wann und wie viel es nachdenkt, und steuere es mit Effort und Prompting.
Verstehe, wie Nachdenken funktioniert, wann Claude standardmäßig nachdenkt und wie Nachdenken mit Effort zusammenwirkt.
Compatibility
- Supported models
- Fable 5 and 5.1
- Mythos 5, 5.1, and Preview
- Opus 4.5, 4.6, 4.7, 4.8, 5, and 5.5
- Sonnet 4.6, 5, and 5.5
- Haiku 5.5
- Supported platforms
- Claude API
- Claude Platform on AWS
- Amazon Bedrock
- Google Cloud
- Microsoft Foundry
Was this page helpful?