Claude Platform Docs
MessagesGerenciamento de contexto

Visão geral da compactação

Saiba o que a compactação faz, como a compactação sob demanda e a compactação em um limite de tokens diferem e qual página aborda sua tarefa.

A "compaction" (compactação) substitui os turnos mais antigos de uma conversa por um resumo que Claude escreve no servidor, então você não precisa de nenhum código de sumarização próprio. Ela mantém uma conversa longa ou uma tarefa de agente dentro da "context window" (janela de contexto). Ela também mantém o contexto ativo pequeno, porque a qualidade das respostas se degrada à medida que uma conversa cresce.

Se quiser pular esta visão geral, comece por Compactação sob demanda para adicionar compactação à sua aplicação. Ela e a Compactação em um limite de tokens estão ambas em beta, mas a Compactação sob demanda abrange mais casos de uso comuns. Para limpar resultados de ferramentas antigos ou blocos de pensamento antigos por regra em vez de resumi-los, consulte Edição de contexto.

Escolha como compactar

Use a compactação sob demanda sempre que ela estiver disponível.

Compactação sob demandaCompactação em um limite de tokensSeu próprio sumarizador (Compactar no cliente)
Quem decide quandoVocê, enviando uma solicitaçãoA API, quando os tokens de entrada atingem o gatilho que você definiuVocê
Código que você escreveUm loop de compactação que solicita o resumo e o substitui no históricoUm parâmetro nas suas solicitações comunsA chamada de sumarização, seu prompt e a reescrita do histórico
O que você envia de volta depoisO bloco retornado primeiro em messages, no lugar das mensagens que ele resumeA resposta, anexada normalmente. A API descarta o que veio antes do blocoSeu resumo, como uma mensagem sua
Turnos recentes permanecem palavra por palavraSim: Compactação que mantém turnos recentesSim, pausando após a compactação e reinserindo-osSim
Executa em segundo planoSim: Compactação em segundo planoNão: ela é executada dentro da solicitação que atinge o limiteSim, no seu próprio código
Turnos mantidos preservam seu pensamento, em modelos com pensamento preservadoSim, nas condições descritas em Compactação e pensamento preservadoNão: no Claude Fable 5.1, Claude Opus 5.5 e Claude Sonnet 5.5, remova ou descarte o pensamento nos turnos que você reinserir (consulte os exemplos de compactação por limite)Não: esse pensamento falha na verificação
Cabeçalho beta, parâmetro e plataformascompact-2026-09-04 e o parâmetro compaction de nível superior. Plataformas: consulte a lista de Compatibilidade sob demandaConsulte a lista de Compatibilidade por limite e Uso básicoNenhum. É executado no seu código
Escolha quandoSua aplicação precisa controlar quando a compactação acontece, não pode pausar enquanto um resumo é escrito, ou precisa manter turnos recentes e seu pensamentoVocê quer que a API gerencie o contexto dentro de solicitações comunsVocê já executa seu próprio sumarizador e ele substitui todo o histórico pelo resumo

Opções de compactação sob demanda

A Compactação sob demanda mostra um loop que resume toda a conversa enquanto sua aplicação aguarda. As duas primeiras páginas desta lista mudam a forma como esse loop é executado, e você pode combiná-las. A terceira se aplica se você envia blocos de pensamento de volta e usa qualquer uma das duas.

Encontre estes tópicos em outras páginas:

A compactação por limite tem sua própria página: Compactação em um limite de tokens.

Was this page helpful?