Definições de ferramentas e blocos tool_result acumulados consomem sua "context window" (janela de contexto). Agentes de longa duração com muitas ferramentas ou muitos turnos podem esgotar o contexto disponível antes que a tarefa seja concluída. Quatro abordagens tratam disso em diferentes pontos do pipeline.
Cada abordagem visa uma fonte diferente de pressão sobre o contexto. Escolha aquela que corresponde a onde seus tokens estão sendo gastos.
| Abordagem | O que reduz | Quando se aplica | Saiba mais |
|---|---|---|---|
| Busca de ferramentas | Definições de ferramentas carregadas antecipadamente | Conjuntos grandes de ferramentas (20+ ferramentas) em que a maioria não é necessária a cada turno | Ferramenta de busca de ferramentas |
| Chamada programática de ferramentas | Idas e vindas de tool_result | Cadeias de chamadas de ferramentas que podem ser executadas como um único script | Chamada programática de ferramentas |
| Cache de prompt | Custo em tokens de definições de ferramentas repetidas | Conjuntos de ferramentas estáveis em muitas requisições | Uso de ferramentas com cache de prompt |
| Edição de contexto | Blocos tool_result antigos no histórico | Conversas longas em que resultados iniciais não são mais relevantes | Edição de contexto |
A busca de ferramentas mantém as definições de ferramentas fora da janela de contexto até que Claude as solicite. Em vez de enviar 50 esquemas de ferramentas antecipadamente, você envia uma única ferramenta tool_search e deixa Claude descobrir o restante sob demanda. Isso troca uma pequena quantidade de "latency" (latência) — um turno extra para buscar uma ferramenta — por uma grande redução no uso de contexto base.
A chamada programática de ferramentas condensa uma sequência de chamadas de ferramentas em um único bloco de código que Claude escreve e o sandbox de execução de código da Anthropic executa. Em vez de cinco idas e vindas de tool_use e tool_result, Claude emite um script que chama todas as cinco funções de dentro do sandbox. Os resultados intermediários nunca entram no histórico da conversa.
O "prompt caching" (cache de prompt) não reduz o número de tokens no contexto, mas reduz o que você paga por eles em requisições subsequentes. Se suas definições de ferramentas são estáveis, armazene-as em cache uma vez e reutilize o prefixo em cache em milhares de requisições. Essa é a escolha certa quando o conjunto de ferramentas é grande, mas fixo.
A edição de contexto remove blocos tool_result antigos do histórico da conversa depois que eles cumpriram seu propósito. Um loop de agente longo pode produzir centenas de resultados intermediários que foram úteis no momento, mas agora são peso morto. A edição de contexto permite que você os remova sem reiniciar a conversa.
Essas abordagens são componíveis. Um agente de longa duração pode usar busca de ferramentas para manter o conjunto de ferramentas enxuto, cache de prompt para amortizar o custo das definições restantes e edição de contexto para remover resultados obsoletos à medida que a conversa cresce. Cada uma resolve uma parte diferente do problema, então não há conflito em usá-las juntas.
Um ponto de partida razoável para um agente de alto volume:
Carregue definições de ferramentas sob demanda em vez de antecipadamente.
Condense cadeias de chamadas de ferramentas em um único script executável.
Armazene definições de ferramentas em cache entre requisições para reduzir custos de tokens.
Remova resultados de ferramentas obsoletos de conversas de longa duração.
Was this page helpful?