Überblick über die Komprimierung
Erfahre, was die Komprimierung bewirkt, wie sich die Komprimierung auf Anfrage und die Komprimierung bei einem Token-Schwellenwert unterscheiden und welche Seite deine Aufgabe abdeckt.
„Compaction“ (Komprimierung) ersetzt die älteren Turns einer Konversation durch eine Zusammenfassung, die Claude auf dem Server schreibt, sodass du keinen eigenen Zusammenfassungscode benötigst. Sie hält eine lange Konversation oder Agent-Aufgabe innerhalb des „context window“ (Kontextfenster) und hält den aktiven Kontext klein, da die Antwortqualität mit wachsender Konversation abnimmt.
Wenn du diese Übersicht überspringen möchtest, beginne mit Komprimierung auf Anfrage, um deiner Anwendung Komprimierung hinzuzufügen. Obwohl sich sowohl diese als auch Komprimierung bei einem Token-Schwellenwert in der Beta befinden, deckt die Komprimierung auf Anfrage mehr gängige Anwendungsfälle ab. Um alte Tool-Ergebnisse oder alte Thinking-Blöcke regelbasiert zu entfernen, anstatt sie zusammenzufassen, siehe Kontextbearbeitung.
Wähle, wie komprimiert werden soll
Verwende die Komprimierung auf Anfrage überall dort, wo sie verfügbar ist.
| Komprimierung auf Anfrage | Komprimierung bei einem Token-Schwellenwert | Dein eigener Zusammenfasser (Auf dem Client komprimieren) | |
|---|---|---|---|
| Wer entscheidet, wann | Du, indem du eine Anfrage sendest | Die API, wenn die Eingabe-Token den von dir festgelegten Auslöser erreichen | Du |
| Code, den du schreibst | Eine Komprimierungsschleife, die die Zusammenfassung anfordert und sie einsetzt | Ein Parameter in deinen gewöhnlichen Anfragen | Der Zusammenfassungsaufruf, sein Prompt und das Umschreiben des Verlaufs |
| Was du danach zurücksendest | Den zurückgegebenen Block an erster Stelle in messages, anstelle der Nachrichten, die er zusammenfasst | Die Antwort, wie gewohnt angehängt. Die API verwirft, was vor dem Block kam | Deine Zusammenfassung als eigene Nachricht |
| Aktuelle Turns bleiben wortwörtlich erhalten | Ja: Komprimierung, die aktuelle Turns beibehält | Ja, indem du nach der Komprimierung pausierst und sie wieder einfügst | Ja |
| Läuft im Hintergrund | Ja: Komprimierung im Hintergrund | Nein: Sie läuft innerhalb der Anfrage, die den Schwellenwert erreicht | Ja, in deinem eigenen Code |
| Beibehaltene Turns behalten ihr Nachdenken, bei Modellen mit „preserved thinking" (beibehaltenes Nachdenken) | Ja, unter den Bedingungen in Komprimierung und beibehaltenes Nachdenken | Nein: Bei Claude Fable 5.1, Claude Opus 5.5 und Claude Sonnet 5.5 entferne oder verwirf das Nachdenken in Turns, die du wieder einfügst (siehe die Beispiele zur Schwellenwert-Komprimierung) | Nein: Dieses Nachdenken besteht die Prüfung nicht |
| Beta-Header, Parameter und Plattformen | compact-2026-09-04 und der Top-Level-Parameter compaction. Plattformen: siehe die Kompatibilitätsliste für die Komprimierung auf Anfrage | Siehe die Kompatibilitätsliste für die Schwellenwert-Komprimierung und Grundlegende Verwendung | Keine. Sie läuft in deinem Code |
| Wähle sie, wenn | Deine Anwendung steuern muss, wann die Komprimierung stattfindet, nicht pausieren kann, während eine Zusammenfassung geschrieben wird, oder aktuelle Turns und ihr Nachdenken beibehalten muss | Du möchtest, dass die API den Kontext innerhalb gewöhnlicher Anfragen verwaltet | Du bereits deinen eigenen Zusammenfasser betreibst und dieser den gesamten Verlauf durch die Zusammenfassung ersetzt |
Optionen für die Komprimierung auf Anfrage
Komprimierung auf Anfrage zeigt eine Schleife, die die gesamte Konversation zusammenfasst, während deine Anwendung wartet. Die ersten beiden Seiten in dieser Liste ändern, wie diese Schleife abläuft, und du kannst sie kombinieren. Die dritte ist relevant, wenn du Thinking-Blöcke zurücksendest und eine der beiden Optionen nutzt.
- Komprimierung, die die letzten Turns beibehält: wenn die letzten Turns Claude wortwörtlich erreichen müssen. Die Zusammenfassung deckt nur die älteren Turns ab.
- Komprimierung im Hintergrund: wenn die Konversation für die Zusammenfassung nicht pausieren kann. Die Anfrage läuft, während die Arbeit weitergeht, und du setzt den Block ein, sobald er eintrifft.
- Komprimierung und beibehaltenes Nachdenken: wenn du Thinking-Blöcke bei einem Modell mit beibehaltenem Nachdenken zurücksendest und die letzten Turns beibehältst oder im Hintergrund komprimierst. Andernfalls überspringe diese Seite.
- Eigenen Zusammenfassungs-Prompt schreiben: wenn die Standardzusammenfassung etwas auslässt, das ein späterer Turn benötigt. Dein Prompt ersetzt den Standard-Prompt.
- Erneut komprimieren: wenn eine Konversation, die bereits mit einem Komprimierungsblock beginnt, wieder lang wird.
Diese Themen findest du auf anderen Seiten:
- Eine Zusammenfassung anfordern befindet sich auf der Seite „Komprimierung auf Anfrage“.
- Ab der Zusammenfassung fortfahren befindet sich auf der Seite „Komprimierung auf Anfrage“. Die Bedingungen, unter denen das Thinking in den beibehaltenen Turns gültig bleibt, findest du auf der Seite Komprimierung und beibehaltenes Nachdenken.
- Wenn keine Zusammenfassung zurückkommt: siehe Fehlende Zusammenfassung oder Fehler behandeln auf der Seite „Komprimierung auf Anfrage“.
- Wie sie sich in den Rest der API einfügt: siehe Einschränkungen und Wechselwirkungen mit anderen Funktionen auf der Seite „Komprimierung auf Anfrage“.
- Nutzung verstehen: siehe Komprimierungsnutzung zählen für die Komprimierung auf Anfrage oder Nutzung verstehen für die Schwellenwert-Komprimierung.
- Kompatibilität: Jede Art hat ihren eigenen Beta-Header, daher hat jede Seite ihre eigene Liste. Siehe die Kompatibilitätsliste für Komprimierung auf Anfrage oder die Kompatibilitätsliste für Schwellenwert-Komprimierung.
Die Schwellenwert-Komprimierung hat eine eigene Seite: Komprimierung bei einem Token-Schwellenwert.
Was this page helpful?