Las definiciones de herramientas y los bloques tool_result acumulados consumen tu "context window" (ventana de contexto). Los agentes de larga duración con muchas herramientas o muchos turnos pueden agotar el contexto disponible antes de que la tarea termine. Cuatro enfoques abordan esto en diferentes puntos del pipeline.
Cada enfoque apunta a una fuente diferente de presión sobre el contexto. Elige el que corresponda a dónde se están yendo tus tokens.
| Enfoque | Qué reduce | Cuándo aplica | Más información |
|---|---|---|---|
| Búsqueda de herramientas | Definiciones de herramientas cargadas de antemano | Conjuntos grandes de herramientas (más de 20) donde la mayoría no se necesita en cada turno | Herramienta de búsqueda de herramientas |
| Llamadas programáticas a herramientas | Idas y vueltas de tool_result | Cadenas de llamadas a herramientas que pueden ejecutarse como un solo script | Llamadas programáticas a herramientas |
| Almacenamiento en caché de prompts | Costo en tokens de definiciones de herramientas repetidas | Conjuntos de herramientas estables a lo largo de muchas solicitudes | Uso de herramientas con almacenamiento en caché de prompts |
| Edición de contexto | Bloques tool_result antiguos en el historial | Conversaciones largas donde los resultados iniciales ya no son relevantes | Edición de contexto |
La búsqueda de herramientas mantiene las definiciones de herramientas fuera de la ventana de contexto hasta que Claude las solicita. En lugar de enviar 50 esquemas de herramientas de antemano, envías una sola herramienta tool_search y dejas que Claude descubra el resto bajo demanda. Esto intercambia una pequeña cantidad de latencia (un turno adicional para buscar una herramienta) por una gran reducción en el uso base de contexto.
Las llamadas programáticas a herramientas colapsan una secuencia de llamadas a herramientas en un solo bloque de código que Claude escribe y que el sandbox de ejecución de código de Anthropic ejecuta. En lugar de cinco idas y vueltas de tool_use y tool_result, Claude emite un script que llama a las cinco funciones desde dentro del sandbox. Los resultados intermedios nunca entran en el historial de la conversación.
El "prompt caching" (almacenamiento en caché de prompts) no reduce la cantidad de tokens en el contexto, pero reduce lo que pagas por ellos en solicitudes posteriores. Si tus definiciones de herramientas son estables, almacénalas en caché una vez y reutiliza el prefijo en caché en miles de solicitudes. Esta es la opción correcta cuando el conjunto de herramientas es grande pero fijo.
La edición de contexto elimina bloques tool_result antiguos del historial de la conversación una vez que han cumplido su propósito. Un bucle de agente largo podría producir cientos de resultados intermedios que fueron útiles en su momento pero que ahora son peso muerto. La edición de contexto te permite recortarlos sin reiniciar la conversación.
Estos enfoques se componen entre sí. Un agente de larga duración podría usar búsqueda de herramientas para mantener el conjunto de herramientas reducido, almacenamiento en caché de prompts para amortizar el costo de las definiciones restantes, y edición de contexto para recortar resultados obsoletos a medida que la conversación crece. Cada uno resuelve una parte diferente del problema, así que no hay conflicto en usarlos juntos.
Un punto de partida razonable para un agente de alto volumen:
Carga definiciones de herramientas bajo demanda en lugar de hacerlo de antemano.
Colapsa cadenas de llamadas a herramientas en un solo script ejecutable.
Almacena en caché las definiciones de herramientas entre solicitudes para reducir los costos de tokens.
Recorta resultados de herramientas obsoletos de conversaciones de larga duración.
Was this page helpful?