Claude Platform Docs
MessagesKontextverwaltung

Überblick über die Komprimierung

Erfahre, was die Komprimierung bewirkt, wie sich die Komprimierung auf Anfrage und die Komprimierung bei einem Token-Schwellenwert unterscheiden und welche Seite deine Aufgabe abdeckt.

„Compaction“ (Komprimierung) ersetzt die älteren Turns einer Konversation durch eine Zusammenfassung, die Claude auf dem Server schreibt, sodass du keinen eigenen Zusammenfassungscode benötigst. Sie hält eine lange Konversation oder Agent-Aufgabe innerhalb des „context window“ (Kontextfenster) und hält den aktiven Kontext klein, da die Antwortqualität mit wachsender Konversation abnimmt.

Wenn du diese Übersicht überspringen möchtest, beginne mit Komprimierung auf Anfrage, um deiner Anwendung Komprimierung hinzuzufügen. Obwohl sich sowohl diese als auch Komprimierung bei einem Token-Schwellenwert in der Beta befinden, deckt die Komprimierung auf Anfrage mehr gängige Anwendungsfälle ab. Um alte Tool-Ergebnisse oder alte Thinking-Blöcke regelbasiert zu entfernen, anstatt sie zusammenzufassen, siehe Kontextbearbeitung.

Wähle, wie komprimiert werden soll

Verwende die Komprimierung auf Anfrage überall dort, wo sie verfügbar ist.

Komprimierung auf AnfrageKomprimierung bei einem Token-SchwellenwertDein eigener Zusammenfasser (Auf dem Client komprimieren)
Wer entscheidet, wannDu, indem du eine Anfrage sendestDie API, wenn die Eingabe-Token den von dir festgelegten Auslöser erreichenDu
Code, den du schreibstEine Komprimierungsschleife, die die Zusammenfassung anfordert und sie einsetztEin Parameter in deinen gewöhnlichen AnfragenDer Zusammenfassungsaufruf, sein Prompt und das Umschreiben des Verlaufs
Was du danach zurücksendestDen zurückgegebenen Block an erster Stelle in messages, anstelle der Nachrichten, die er zusammenfasstDie Antwort, wie gewohnt angehängt. Die API verwirft, was vor dem Block kamDeine Zusammenfassung als eigene Nachricht
Aktuelle Turns bleiben wortwörtlich erhaltenJa: Komprimierung, die aktuelle Turns beibehältJa, indem du nach der Komprimierung pausierst und sie wieder einfügstJa
Läuft im HintergrundJa: Komprimierung im HintergrundNein: Sie läuft innerhalb der Anfrage, die den Schwellenwert erreichtJa, in deinem eigenen Code
Beibehaltene Turns behalten ihr Nachdenken, bei Modellen mit „preserved thinking" (beibehaltenes Nachdenken)Ja, unter den Bedingungen in Komprimierung und beibehaltenes NachdenkenNein: Bei Claude Fable 5.1, Claude Opus 5.5 und Claude Sonnet 5.5 entferne oder verwirf das Nachdenken in Turns, die du wieder einfügst (siehe die Beispiele zur Schwellenwert-Komprimierung)Nein: Dieses Nachdenken besteht die Prüfung nicht
Beta-Header, Parameter und Plattformencompact-2026-09-04 und der Top-Level-Parameter compaction. Plattformen: siehe die Kompatibilitätsliste für die Komprimierung auf AnfrageSiehe die Kompatibilitätsliste für die Schwellenwert-Komprimierung und Grundlegende VerwendungKeine. Sie läuft in deinem Code
Wähle sie, wennDeine Anwendung steuern muss, wann die Komprimierung stattfindet, nicht pausieren kann, während eine Zusammenfassung geschrieben wird, oder aktuelle Turns und ihr Nachdenken beibehalten mussDu möchtest, dass die API den Kontext innerhalb gewöhnlicher Anfragen verwaltetDu bereits deinen eigenen Zusammenfasser betreibst und dieser den gesamten Verlauf durch die Zusammenfassung ersetzt

Optionen für die Komprimierung auf Anfrage

Komprimierung auf Anfrage zeigt eine Schleife, die die gesamte Konversation zusammenfasst, während deine Anwendung wartet. Die ersten beiden Seiten in dieser Liste ändern, wie diese Schleife abläuft, und du kannst sie kombinieren. Die dritte ist relevant, wenn du Thinking-Blöcke zurücksendest und eine der beiden Optionen nutzt.

  • Komprimierung, die die letzten Turns beibehält: wenn die letzten Turns Claude wortwörtlich erreichen müssen. Die Zusammenfassung deckt nur die älteren Turns ab.
  • Komprimierung im Hintergrund: wenn die Konversation für die Zusammenfassung nicht pausieren kann. Die Anfrage läuft, während die Arbeit weitergeht, und du setzt den Block ein, sobald er eintrifft.
  • Komprimierung und beibehaltenes Nachdenken: wenn du Thinking-Blöcke bei einem Modell mit beibehaltenem Nachdenken zurücksendest und die letzten Turns beibehältst oder im Hintergrund komprimierst. Andernfalls überspringe diese Seite.
  • Eigenen Zusammenfassungs-Prompt schreiben: wenn die Standardzusammenfassung etwas auslässt, das ein späterer Turn benötigt. Dein Prompt ersetzt den Standard-Prompt.
  • Erneut komprimieren: wenn eine Konversation, die bereits mit einem Komprimierungsblock beginnt, wieder lang wird.

Diese Themen findest du auf anderen Seiten:

Die Schwellenwert-Komprimierung hat eine eigene Seite: Komprimierung bei einem Token-Schwellenwert.

Was this page helpful?