Visão geral da compactação
Saiba o que a compactação faz, como a compactação sob demanda e a compactação em um limite de tokens diferem e qual página aborda sua tarefa.
A "compaction" (compactação) substitui os turnos mais antigos de uma conversa por um resumo que Claude escreve no servidor, então você não precisa de nenhum código de sumarização próprio. Ela mantém uma conversa longa ou uma tarefa de agente dentro da "context window" (janela de contexto). Ela também mantém o contexto ativo pequeno, porque a qualidade das respostas se degrada à medida que uma conversa cresce.
Se quiser pular esta visão geral, comece por Compactação sob demanda para adicionar compactação à sua aplicação. Ela e a Compactação em um limite de tokens estão ambas em beta, mas a Compactação sob demanda abrange mais casos de uso comuns. Para limpar resultados de ferramentas antigos ou blocos de pensamento antigos por regra em vez de resumi-los, consulte Edição de contexto.
Escolha como compactar
Use a compactação sob demanda sempre que ela estiver disponível.
| Compactação sob demanda | Compactação em um limite de tokens | Seu próprio sumarizador (Compactar no cliente) | |
|---|---|---|---|
| Quem decide quando | Você, enviando uma solicitação | A API, quando os tokens de entrada atingem o gatilho que você definiu | Você |
| Código que você escreve | Um loop de compactação que solicita o resumo e o substitui no histórico | Um parâmetro nas suas solicitações comuns | A chamada de sumarização, seu prompt e a reescrita do histórico |
| O que você envia de volta depois | O bloco retornado primeiro em messages, no lugar das mensagens que ele resume | A resposta, anexada normalmente. A API descarta o que veio antes do bloco | Seu resumo, como uma mensagem sua |
| Turnos recentes permanecem palavra por palavra | Sim: Compactação que mantém turnos recentes | Sim, pausando após a compactação e reinserindo-os | Sim |
| Executa em segundo plano | Sim: Compactação em segundo plano | Não: ela é executada dentro da solicitação que atinge o limite | Sim, no seu próprio código |
| Turnos mantidos preservam seu pensamento, em modelos com pensamento preservado | Sim, nas condições descritas em Compactação e pensamento preservado | Não: no Claude Fable 5.1, Claude Opus 5.5 e Claude Sonnet 5.5, remova ou descarte o pensamento nos turnos que você reinserir (consulte os exemplos de compactação por limite) | Não: esse pensamento falha na verificação |
| Cabeçalho beta, parâmetro e plataformas | compact-2026-09-04 e o parâmetro compaction de nível superior. Plataformas: consulte a lista de Compatibilidade sob demanda | Consulte a lista de Compatibilidade por limite e Uso básico | Nenhum. É executado no seu código |
| Escolha quando | Sua aplicação precisa controlar quando a compactação acontece, não pode pausar enquanto um resumo é escrito, ou precisa manter turnos recentes e seu pensamento | Você quer que a API gerencie o contexto dentro de solicitações comuns | Você já executa seu próprio sumarizador e ele substitui todo o histórico pelo resumo |
Opções de compactação sob demanda
A Compactação sob demanda mostra um loop que resume toda a conversa enquanto sua aplicação aguarda. As duas primeiras páginas desta lista mudam a forma como esse loop é executado, e você pode combiná-las. A terceira se aplica se você envia blocos de pensamento de volta e usa qualquer uma das duas.
- Compactação que mantém turnos recentes: quando os últimos turnos precisam chegar a Claude palavra por palavra. O resumo abrange apenas os turnos mais antigos.
- Compactação em segundo plano: quando a conversa não pode pausar para o resumo. A solicitação é executada enquanto o trabalho continua, e você substitui o bloco no histórico quando ele chega.
- Compactação e pensamento preservado: se você envia blocos de pensamento de volta em um modelo com pensamento preservado e mantém turnos recentes ou compacta em segundo plano. Caso contrário, pule esta página.
- Escrever seu próprio prompt de sumarização: quando o resumo padrão omite algo de que um turno posterior precisa. Seu prompt substitui o padrão.
- Compactar novamente: quando uma conversa que já começa com um bloco de compactação fica longa novamente.
Encontre estes tópicos em outras páginas:
- Solicitar um resumo está em Compactação sob demanda.
- Continuar a partir do resumo está em Compactação sob demanda. As condições que mantêm o pensamento válido nos turnos que você mantém estão em Compactação e pensamento preservado.
- Quando nenhum resumo é retornado: consulte Lidar com um resumo ausente ou um erro em Compactação sob demanda.
- Como ela se encaixa no restante da API: consulte Limites e interações com outros recursos em Compactação sob demanda.
- Entendendo o uso: consulte Contabilizar o uso da compactação para a compactação sob demanda, ou Entendendo o uso para a compactação por limite.
- Compatibilidade: cada tipo tem seu próprio cabeçalho beta, então cada página tem sua própria lista. Consulte a lista de Compatibilidade sob demanda ou a lista de Compatibilidade por limite.
A compactação por limite tem sua própria página: Compactação em um limite de tokens.
Was this page helpful?