El "extended thinking" (pensamiento extendido) en modo manual te da control directo sobre cuánto piensa Claude. Estableces un presupuesto de tokens de pensamiento en cada solicitud con thinking: {type: "enabled", budget_tokens: N}, y Claude piensa dentro de ese presupuesto antes de comenzar su respuesta final. El modo manual sigue siendo útil cuando tu carga de trabajo requiere latencia predecible o control preciso sobre los costos de pensamiento. Esta página cubre cómo establecer y ajustar el presupuesto, cómo interactúa el modo manual con el pensamiento intercalado y el almacenamiento en caché de prompts, y cómo migrar al pensamiento adaptativo.
Para saber cómo funciona el pensamiento en sí, incluidos los bloques de pensamiento y la forma de la respuesta, el parámetro display, el streaming, el pensamiento con uso de herramientas y el cifrado, consulta la descripción general del pensamiento.
La disponibilidad del pensamiento extendido por modelo, incluidos los modelos donde el pensamiento extendido es el único modo, se indica en la tabla de configuración por modelo.
Aquí tienes un ejemplo de uso del pensamiento extendido en la API de Messages:
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-sonnet-4-6",
max_tokens=16000,
thinking={"type": "enabled", "budget_tokens": 10000},
messages=[
{
"role": "user",
"content": "Are there an infinite number of prime numbers such that n mod 4 == 3?",
}
],
)
# La respuesta contiene bloques de pensamiento resumidos y bloques de texto
for block in response.content:
match block.type:
case "thinking":
print(f"\nThinking summary: {block.thinking}")
case "text":
print(f"\nResponse: {block.text}")Para activar el pensamiento extendido manual, agrega un objeto thinking con type establecido en enabled y un valor de budget_tokens.
El parámetro budget_tokens establece un objetivo de cuántos tokens puede usar Claude para su proceso de razonamiento interno. Los presupuestos más grandes pueden mejorar la calidad de la respuesta al permitir un análisis más exhaustivo para problemas complejos.
budget_tokens debe satisfacer estas restricciones:
max_tokens. Los tokens de pensamiento cuentan para el límite de max_tokens del turno, por lo que el presupuesto debe dejar espacio para la respuesta final. La única excepción es el pensamiento intercalado, donde budget_tokens puede exceder max_tokens porque el presupuesto abarca todos los bloques de pensamiento dentro de un turno del asistente.budget_tokens debe ser menor que max_tokens, el pensamiento extendido no se puede combinar con max_tokens: 0 (precalentamiento de caché).El presupuesto es un objetivo más que un límite estricto. El uso real de tokens varía según la tarea, y Claude puede dejar de razonar mucho antes de agotar el presupuesto; max_tokens sigue siendo el tope absoluto de la salida total.
En Claude Opus 4.5, el único modelo exclusivo de pensamiento extendido que admite effort, el effort da forma a la respuesta general mientras que budget_tokens establece la profundidad del pensamiento; configura ambos.
Para ajustar el presupuesto:
Para hacer seguimiento de lo que realmente te cuesta un presupuesto, monitorea el campo usage.output_tokens_details.thinking_tokens en la respuesta, que informa cuántos de los tokens de salida facturados fueron razonamiento interno. Al usar streaming, este desglose aparece solo en el evento final message_delta.
Cuando estés listo para dejar los presupuestos manuales, consulta Migración al pensamiento adaptativo.
El "interleaved thinking" (pensamiento intercalado) permite que Claude piense entre llamadas a herramientas dentro de un solo turno del asistente, razonando sobre cada resultado de herramienta antes de decidir qué hacer a continuación. Para el concepto, la estructura del turno y cómo se comporta en modelos de pensamiento adaptativo, consulta pensamiento intercalado en la descripción general del pensamiento. Esta sección cubre cómo habilitarlo cuando usas el pensamiento manual type: "enabled".
En Claude Opus 4.5, Claude Sonnet 4.5 y modelos anteriores de Claude 4 (Claude Opus 4.1, Claude Opus 4 y Claude Sonnet 4), agrega el encabezado beta interleaved-thinking-2025-05-14 a tu solicitud de API.
La generación 4.6 se divide en modo manual:
type: "enabled" manual sigue siendo funcional pero está obsoleto. Prefiere el pensamiento adaptativo, que intercala automáticamente sin encabezado.thinking: {type: "adaptive"} si necesitas razonamiento entre llamadas a herramientas en este modelo.Claude Haiku 4.5 no admite pensamiento intercalado. En la API de Claude, el encabezado beta se acepta pero se ignora.
Dos consideraciones más para el pensamiento intercalado en modo manual:
budget_tokens puede exceder max_tokens aquí; las reglas del presupuesto explican esta excepción.La forma en que las plataformas tratan el encabezado beta difiere. La API de Claude y Claude Platform en AWS aceptan interleaved-thinking-2025-05-14 en cualquier modelo y lo ignoran donde no es compatible. La aceptación no es lo mismo que el efecto: en modelos que rechazan type: "enabled" (4.7 y posteriores) o que carecen de intercalado en modo manual (Claude Opus 4.6), el encabezado no tiene efecto en modo manual; el pensamiento adaptativo intercala automáticamente allí.
Las plataformas operadas por socios (Amazon Bedrock y Google Cloud) también aceptan el encabezado en cualquier modelo sin devolver un error, y lo ignoran en modelos que no admiten pensamiento intercalado.
Las reglas generales de estructura de turnos, incluido el bucle de uso de herramientas de un solo turno, el manejo de conflictos a mitad de turno y la alternancia del pensamiento entre turnos, están en Pensamiento con uso de herramientas.
El modo manual agrega un requisito: el turno final del asistente de una solicitud con pensamiento habilitado debe comenzar con un bloque de pensamiento (el pensamiento adaptativo elimina ese requisito). Cambiar la configuración de pensamiento entre turnos también invalida el almacenamiento en caché de prompts; consulta la siguiente sección.
El modo manual agrega una regla además del comportamiento de caché neutral al modo descrito en pensamiento y almacenamiento en caché de prompts: cambiar budget_tokens entre solicitudes invalida los puntos de interrupción de caché, al igual que cambiar de modo de pensamiento, porque el valor del presupuesto se renderiza en el prompt. Los puntos de interrupción a nivel de mensaje siempre fallan después de un cambio de presupuesto; que los puntos de interrupción de herramientas y de indicación del sistema también fallen depende de dónde renderiza el modelo la configuración.
En la práctica, elige un presupuesto y mantenlo estable durante la vida de una conversación en caché. Ejecutar una conversación de varios turnos con caché a nivel de mensaje en Claude Sonnet 4.6 y cambiar el presupuesto en la tercera solicitud de 4,000 a 8,000 tokens muestra la invalidación directamente:
First request - establishing cache
First response usage: { cache_creation_input_tokens: 1370, cache_read_input_tokens: 0, input_tokens: 17, output_tokens: 700 }
Second request - same thinking parameters (cache hit expected)
Second response usage: { cache_creation_input_tokens: 0, cache_read_input_tokens: 1370, input_tokens: 303, output_tokens: 874 }
Third request - different thinking budget (cache miss expected)
Third response usage: { cache_creation_input_tokens: 1370, cache_read_input_tokens: 0, input_tokens: 747, output_tokens: 619 }La tercera solicitud vuelve a crear la caché (cache_creation_input_tokens=1370, cache_read_input_tokens=0) porque el presupuesto cambió entre solicitudes. Para una versión ejecutable del mismo experimento en modo adaptativo, donde el nivel de effort desempeña el papel de caché que budget_tokens desempeña aquí, consulta Almacenamiento en caché de prompts en la página de dirección.
La mayor parte del comportamiento del pensamiento es neutral al modo y se documenta una sola vez en la página de Pensamiento. Todo lo que aparece allí también aplica en modo manual:
Si tu modelo solo admite pensamiento extendido (Claude Sonnet 4.5, Claude Opus 4.5, Claude Haiku 4.5 y modelos anteriores de Claude 4), no se necesita ninguna acción ahora: el pensamiento adaptativo no está disponible allí, y type: "adaptive" devuelve un error 400. Mantén budget_tokens hasta que pases a un modelo que admita pensamiento adaptativo, y luego aplica el mapeo que sigue.
Necesitas migrar de type: "enabled" si:
budget_tokens está obsoleto.type: "enabled" devuelve un error 400.El mapeo es pequeño: elimina budget_tokens, establece thinking: {type: "adaptive"} y controla la profundidad del razonamiento con output_config: {effort: ...} en lugar de un presupuesto de tokens.
{
"model": "claude-sonnet-4-6",
"max_tokens": 16000,
"thinking": {
"type": "enabled",
"budget_tokens": 10000
}
}se convierte en:
{
"model": "claude-sonnet-4-6",
"max_tokens": 16000,
"thinking": {
"type": "adaptive"
},
"output_config": {
"effort": "high"
}
}effort: "high" coincide con el valor predeterminado de la API; aparece aquí solo para mostrar dónde reside ahora el control de profundidad, y omitirlo produce un comportamiento idéntico.
Espera una diferencia de comportamiento, no solo un cambio de sintaxis. Con un presupuesto fijo, Claude piensa en cada solicitud. Con el pensamiento adaptativo, Claude decide si pensar y cuánto en cada solicitud, y con configuraciones de effort más bajas puede omitir el pensamiento por completo en entradas fáciles. También puedes eliminar el encabezado beta interleaved-thinking-2025-05-14 después de migrar: el pensamiento adaptativo intercala automáticamente, y la API de Claude ignora el encabezado en estos modelos. La preservación de bloques de pensamiento también cambia: Claude Opus 4.5 y los modelos numerados 4.6 y superiores mantienen los bloques de pensamiento de turnos anteriores en el contexto y los facturan como entrada, mientras que Claude Sonnet 4.5, Claude Haiku 4.5 y modelos anteriores los eliminaban; consulta preservación de bloques de pensamiento por modelo.
Cambiar de modo es un cambio de configuración de pensamiento, por lo que la primera solicitud después del cambio invalida los puntos de interrupción de caché, como se describe en Almacenamiento en caché de prompts en modo manual.
Para obtener orientación completa, consulta pensamiento adaptativo, effort y la guía de migración de modelos.
Aprende cómo funciona el pensamiento: bloques, visualización, streaming y uso de herramientas.
Deja que Claude decida cuándo y cuánto pensar en cada solicitud.
Preserva bloques de pensamiento y gestiona el pensamiento entre llamadas a herramientas y turnos.
Was this page helpful?