Esfuerzo
Controla cuántos tokens usa Claude al responder con el parámetro effort, equilibrando entre la exhaustividad de la respuesta y la eficiencia de tokens.
El parámetro "effort" (esfuerzo) te permite controlar cuántos tokens gasta Claude al responder a las solicitudes. Puedes equilibrar entre la exhaustividad de la respuesta y la eficiencia de tokens con un solo modelo. El parámetro effort de nivel superior está disponible en todos los modelos compatibles sin necesidad de un encabezado beta. El esfuerzo por mensaje está en beta.
Establece el nivel de esfuerzo
Establece output_config.effort en la solicitud. El siguiente ejemplo ejecuta una solicitud con esfuerzo medium e imprime el texto de la respuesta.
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-opus-5",
max_tokens=4096,
messages=[
{
"role": "user",
"content": "Analyze the trade-offs between microservices and monolithic architectures",
}
],
output_config={"effort": "medium"},
)
for block in response.content:
if block.type == "text":
print(block.text)Cómo funciona el esfuerzo
De forma predeterminada, Claude usa esfuerzo alto, gastando tantos tokens como sea necesario para obtener resultados excelentes. Puedes elevar el nivel de esfuerzo a max para la capacidad absolutamente más alta, o reducirlo para ser más conservador con el uso de tokens, optimizando la velocidad y el costo mientras aceptas cierta reducción en la capacidad.
El parámetro effort afecta a todos los tokens de la respuesta, incluyendo:
- Respuestas de texto y explicaciones
- Llamadas a herramientas y argumentos de funciones
- Pensamiento (cuando está activo)
Dado que el esfuerzo se aplica a cada token de salida, funciona tanto si el pensamiento está habilitado como si no. Un esfuerzo menor también significa menos llamadas a herramientas y más concisas.
Niveles de esfuerzo
| Nivel | Descripción | Caso de uso típico |
|---|---|---|
max | Capacidad máxima absoluta sin restricciones en el gasto de tokens. Disponible en Claude Fable 5.1, Claude Mythos 5.1, Claude Fable 5, Claude Mythos 5, Claude Mythos Preview, Claude Opus 5, Claude Opus 4.8, Claude Opus 4.7, Claude Opus 4.6, Claude Sonnet 5 y Claude Sonnet 4.6. | Tareas que requieren el razonamiento más profundo posible y el análisis más exhaustivo |
xhigh | Capacidad extendida para trabajo de largo horizonte. Disponible en Claude Fable 5.1, Claude Mythos 5.1, Claude Fable 5, Claude Mythos 5, Claude Opus 5, Claude Opus 4.8, Claude Opus 4.7 y Claude Sonnet 5. | Tareas agénticas y de programación de larga duración (más de 30 minutos) con presupuestos de tokens de millones |
high | Alta capacidad. Equivalente a no establecer el parámetro. | Razonamiento complejo, problemas de programación difíciles, tareas agénticas |
medium | Enfoque equilibrado con ahorro moderado de tokens. | Tareas agénticas que requieren un equilibrio entre velocidad, costo y rendimiento |
low | El más eficiente. Ahorro significativo de tokens con cierta reducción de capacidad. | Tareas más simples que necesitan la mejor velocidad y los costos más bajos, como subagentes |
No todos los modelos que admiten max admiten xhigh.
Las recomendaciones por modelo que siguen prevalecen sobre esta tabla donde difieran.
Niveles de esfuerzo recomendados para Claude Fable 5.1
Claude Fable 5.1 admite los cinco niveles de esfuerzo. Comienza con high, el valor predeterminado. Sube a xhigh o max para el trabajo agéntico y de programación más sensible a la capacidad, y baja a medium o low para trabajo rutinario o sensible a la latencia una vez que tus evaluaciones muestren que la calidad se mantiene. En high y superiores, establece un max_tokens grande. Es un límite estricto sobre la salida total (pensamiento más texto de respuesta). Las mismas recomendaciones se aplican a Claude Mythos 5.1. Consulta Prompting para Claude Fable 5.1.
Claude Fable 5.1 también admite cambiar el esfuerzo a mitad de conversación con un output_config por mensaje, lo que preserva la caché de prompts.
Niveles de esfuerzo recomendados para Claude Fable 5
El esfuerzo es el control principal para equilibrar inteligencia, latencia y costo en Claude Fable 5. Comienza con high, el valor predeterminado, para la mayoría de las tareas, usa xhigh para las cargas de trabajo más sensibles a la capacidad, y baja a medium o low para trabajo rutinario. Las configuraciones de esfuerzo más bajas en Claude Fable 5 siguen funcionando bien y a menudo superan el rendimiento de xhigh en modelos anteriores. En high y xhigh, establece un max_tokens grande. Es un límite estricto sobre la salida total (pensamiento más texto de respuesta). Consulta Control de costos.
Reduce el esfuerzo si una tarea se completa pero tarda más de lo necesario, o si quieres un estilo de trabajo más rápido e interactivo. Las mismas recomendaciones se aplican a Claude Mythos 5. Para una guía más completa, consulta Prompting para Claude Fable 5.
Niveles de esfuerzo recomendados para Claude Opus 5
Claude Opus 5 admite los cinco niveles de esfuerzo. Comienza con high, el valor predeterminado, y ajusta según tus evaluaciones: sube a xhigh para trabajo exigente de programación y agéntico, o a max cuando una tarea justifique un gasto de tokens sin restricciones, y usa low y medium libremente como tu control principal del costo de tokens y el tiempo de respuesta dondequiera que tus evaluaciones muestren que la calidad se mantiene. Si trasladaste configuraciones de esfuerzo de un modelo anterior, ejecuta un nuevo barrido de esfuerzo en tus evaluaciones en lugar de reutilizarlas.
El esfuerzo controla el volumen de pensamiento, no la longitud visible de la respuesta: en Claude Opus 5, cambiar el esfuerzo no acorta las respuestas de forma confiable, así que indica la longitud en el prompt en su lugar.
El valor predeterminado de la API es high. Establece effort explícitamente para usar un nivel diferente. El valor que pases prevalece sobre el predeterminado.
En Claude Opus 5, el pensamiento no se puede deshabilitar con esfuerzo xhigh o max: las solicitudes que establecen thinking: {"type": "disabled"} en esos niveles devuelven un error 400. Consulta Esfuerzo con pensamiento.
Al ejecutar Claude Opus 5 con esfuerzo xhigh o max, establece un max_tokens grande para que el modelo tenga espacio para pensar y actuar a través de subagentes y llamadas a herramientas. Comenzar con 64k tokens y ajustar a partir de ahí es un valor predeterminado razonable.
Claude Opus 5 también admite cambiar el esfuerzo a mitad de conversación con un output_config por mensaje, lo que preserva la caché de prompts.
Niveles de esfuerzo recomendados para Claude Opus 4.8
La guía para Claude Opus 4.7 también se aplica a Claude Opus 4.8. Comienza con xhigh para casos de uso de programación y agénticos, usa high para la mayoría de las demás cargas de trabajo sensibles a la inteligencia, y baja a medium o low solo cuando hayas medido que el nivel inferior mantiene la calidad en tus evaluaciones.
El valor predeterminado de la API es high. Establece effort explícitamente para usar un nivel diferente. El valor que pases prevalece sobre el predeterminado.
Al ejecutar Claude Opus 4.8 con esfuerzo xhigh o max, establece un max_tokens grande para que el modelo tenga espacio para pensar y actuar a través de subagentes y llamadas a herramientas. Comenzar con 64k tokens y ajustar a partir de ahí es un valor predeterminado razonable.
Niveles de esfuerzo recomendados para Claude Opus 4.7
Comienza con xhigh para casos de uso de programación y agénticos, y usa high como mínimo para la mayoría de las cargas de trabajo sensibles a la inteligencia. Baja a medium para cargas de trabajo sensibles al costo, o sube a max solo cuando tus evaluaciones muestren un margen medible en xhigh.
El valor predeterminado de la API es high. Para usar xhigh, establece effort explícitamente. El valor que pases prevalece sobre el predeterminado.
| Esfuerzo | Guía para Claude Opus 4.7 |
|---|---|
low | Eficiente, pero mejor para tareas cortas y delimitadas. Combina low con listas de verificación explícitas si tu tarea tiene múltiples secciones. |
medium | El reemplazo directo para el flujo de trabajo promedio donde quieres buenos resultados mientras reduces costos. |
high | Casos de uso avanzados que aún necesitan un equilibrio entre inteligencia y consumo de tokens. A menudo es el mejor equilibrio entre calidad y eficiencia de tokens. |
xhigh | El punto de partida recomendado para trabajo de programación y agéntico, y para tareas exploratorias como llamadas repetidas a herramientas, búsqueda web detallada y búsqueda en bases de conocimiento. Espera un uso de tokens significativamente mayor que con high. |
max | Resérvalo para problemas de frontera. En la mayoría de las cargas de trabajo, max añade un costo significativo para ganancias de calidad relativamente pequeñas, y en algunas tareas de salida estructurada o menos sensibles a la inteligencia puede llevar a pensar en exceso. |
Claude Opus 4.7 también respeta los niveles de esfuerzo de forma más estricta que Claude Opus 4.6, especialmente en low y medium. En niveles de esfuerzo más bajos, el modelo limita su trabajo a lo que se le pidió en lugar de hacer más de lo solicitado. Si observas un razonamiento superficial en problemas complejos con Claude Opus 4.7, aumenta el esfuerzo en lugar de intentar compensarlo con el prompt. Si debes mantener el esfuerzo bajo por latencia, añade una guía específica como "Esta tarea implica razonamiento de varios pasos. Piensa cuidadosamente antes de responder."
Al ejecutar Claude Opus 4.7 con esfuerzo xhigh o max, establece un max_tokens grande para que el modelo tenga espacio para pensar y actuar a través de subagentes y llamadas a herramientas. Comenzar con 64k tokens y ajustar a partir de ahí es un valor predeterminado razonable.
Niveles de esfuerzo recomendados para Claude Sonnet 5
Claude Sonnet 5 usa esfuerzo high de forma predeterminada en la Claude API y Claude Code.
- Esfuerzo high (predeterminado): Adecuado para razonamiento complejo, programación y tareas agénticas donde la calidad importa más que la velocidad o el costo.
- Esfuerzo xhigh: Para las tareas de programación y agénticas más difíciles. Consulta Prompting para Claude Sonnet 5.
- Esfuerzo medium: Reducción respecto al predeterminado para ahorrar costos. Comparable a Claude Sonnet 4.6 con esfuerzo alto.
- Esfuerzo low: Para cargas de trabajo de alto volumen o sensibles a la latencia. Adecuado para chat y casos de uso no relacionados con programación donde se prioriza una respuesta más rápida.
- Esfuerzo max: Para tareas que requieren la capacidad absolutamente más alta sin restricciones en el gasto de tokens.
Niveles de esfuerzo recomendados para Claude Sonnet 4.6
Sonnet 4.6 usa esfuerzo high de forma predeterminada. Establece el esfuerzo explícitamente al usar Sonnet 4.6 para evitar latencia inesperada:
- Esfuerzo medium (predeterminado recomendado): El mejor equilibrio entre velocidad, costo y rendimiento para la mayoría de las aplicaciones. Adecuado para programación agéntica, flujos de trabajo con uso intensivo de herramientas y generación de código.
- Esfuerzo low: Para cargas de trabajo de alto volumen o sensibles a la latencia. Adecuado para chat y casos de uso no relacionados con programación donde se prioriza una respuesta más rápida.
- Esfuerzo high: Para razonamiento complejo y tareas donde la calidad importa más que la velocidad o el costo.
- Esfuerzo max: Para tareas que requieren la capacidad absolutamente más alta sin restricciones en el gasto de tokens.
Esfuerzo con uso de herramientas
Al usar herramientas, el parámetro effort afecta tanto a las explicaciones en torno a las llamadas a herramientas como a las propias llamadas a herramientas. Los niveles de esfuerzo más bajos tienden a:
- Combinar múltiples operaciones en menos llamadas a herramientas
- Hacer menos llamadas a herramientas
- Proceder directamente a la acción sin preámbulo
- Usar mensajes de confirmación concisos tras completar
Los niveles de esfuerzo más altos pueden:
- Hacer más llamadas a herramientas
- Explicar el plan antes de actuar
- Proporcionar resúmenes detallados de los cambios
- Incluir comentarios de código más completos
Esfuerzo con pensamiento
El parámetro thinking controla si Claude piensa en bloques de pensamiento antes de responder; el parámetro effort controla cuánto trabajo dedica Claude a la respuesta completa, lo que en modo adaptativo incluye con qué frecuencia y con qué profundidad piensa. No pases adaptive como valor de effort: adaptive es un modo de pensamiento, no un nivel de esfuerzo.
En niveles de esfuerzo más altos, Claude piensa en la mayoría de las solicitudes y con mayor extensión. En niveles más bajos, puede omitir el pensamiento por completo para problemas más simples. Consulta Pensamiento y esfuerzo para una guía completa sobre cómo funcionan juntos los dos controles.
En Claude Opus 4.5, el único modelo exclusivo de "extended thinking" (pensamiento extendido) que admite esfuerzo, funciona junto con budget_tokens: establece el nivel de esfuerzo para tu tarea y luego establece el presupuesto de tokens de pensamiento según cuánta profundidad de razonamiento necesite la tarea.
Para la disponibilidad de pensamiento por modelo, consulta la tabla de configuración por modelo. El esfuerzo funciona con o sin pensamiento. Consulta Cómo funciona el esfuerzo.
Cambia el esfuerzo a mitad de conversación
Puedes ejecutar turnos posteriores de una conversación con un nivel de esfuerzo diferente de dos maneras. En Claude Fable 5.1, Claude Mythos 5.1 y Claude Opus 5, usa un cambio de esfuerzo por mensaje, que conserva la caché de prompts. En otros modelos, establece un nuevo valor de nivel superior en la siguiente solicitud, lo que reinicia la caché.
Esfuerzo por mensaje (beta)
El esfuerzo por mensaje está en beta y requiere el encabezado beta mid-conversation-output-config-2026-07-01. Los modelos sin esfuerzo por mensaje, incluido Claude Fable 5, devuelven un error 400: output_config.effort requires a model that supports per-turn effort; this model does not.
Añade un mensaje con role: "system" con content vacío y el nuevo nivel en output_config.effort. El nuevo nivel entra en vigor a partir del siguiente turno user y se mantiene hasta que un mensaje posterior lo cambie. Todo lo anterior a ese mensaje permanece sin cambios, por lo que el prefijo en caché sigue coincidiendo.
El siguiente ejemplo comienza en high y luego baja a low para un seguimiento rutinario:
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-fable-5-1",
max_tokens=4096,
output_config={"effort": "high"},
messages=[
{
"role": "user",
"content": "Plan a migration from SQLite to PostgreSQL in three short steps.",
},
{
"role": "assistant",
"content": "1. Export the SQLite data. 2. Create the PostgreSQL schema. 3. Import the data and verify row counts.",
},
# Mensaje del sistema solo de esfuerzo: el nuevo nivel se aplica a partir del siguiente turno del usuario.
{"role": "system", "content": [], "output_config": {"effort": "low"}},
{"role": "user", "content": "Summarize the plan in one sentence."},
],
betas=["mid-conversation-output-config-2026-07-01"],
)
for block in response.content:
if block.type == "text":
print(block.text)Un mensaje de sistema que solo contiene esfuerzo no lleva texto, por lo que las reglas de ubicación para mensajes de sistema a mitad de conversación no se aplican. Puede aparecer en cualquier lugar de messages, incluso como la primera entrada o entre un turno assistant y el siguiente turno user. Los valores son los nombres de los niveles (low, medium, high, xhigh y max).
En Claude Fable 5.1, prefiere esta forma en lugar de cambiar el valor de nivel superior entre solicitudes. Un cambio de nivel superior reinicia la caché y además dirige al modelo de forma menos confiable: sus respuestas anteriores se escribieron con el nivel previo, y tiende a mantenerse coherente con ellas.
Esfuerzo de nivel superior en la siguiente solicitud
El output_config.effort de nivel superior se aplica a toda la solicitud. Para ejecutar una parte posterior de una conversación con un nivel diferente, establece el nuevo valor en la siguiente solicitud. Dado que el esfuerzo de nivel superior da forma al prompt renderizado, cambiarlo entre solicitudes no preserva los prefijos en caché de turnos anteriores. Si dependes del almacenamiento en caché de prompts a lo largo de una sesión larga y tu modelo no admite esfuerzo por mensaje, elige un nivel de esfuerzo al inicio y mantenlo constante.
Mejores prácticas
- Establece el esfuerzo explícitamente: La API usa
highde forma predeterminada, pero el punto de partida correcto depende de tu modelo y carga de trabajo. - Usa low para tareas simples o sensibles a la velocidad: Cuando la latencia importa o las tareas son sencillas, el esfuerzo bajo puede reducir significativamente los tiempos de respuesta y los costos.
- Prueba tu caso de uso: El impacto de los niveles de esfuerzo varía según el tipo de tarea. Evalúa el rendimiento en tus casos de uso específicos antes de desplegar.
- Considera el esfuerzo dinámico: Ajusta el esfuerzo según la complejidad de la tarea. Las consultas simples pueden justificar un esfuerzo bajo, mientras que la programación agéntica y el razonamiento complejo se benefician de un esfuerzo alto. Consulta el siguiente punto antes de variarlo dentro de una misma conversación.
- Mantén constante el esfuerzo de nivel superior dentro de conversaciones en caché: Cambiar el valor de esfuerzo de nivel superior entre solicitudes invalida el almacenamiento en caché de prompts, así que varíalo entre cargas de trabajo en lugar de dentro de una conversación que dependa de aciertos de caché. En los modelos que lo admiten, usa en su lugar un cambio de esfuerzo por mensaje, que preserva la caché. Consulta Pensamiento y almacenamiento en caché de prompts.
Próximos pasos
Dale a Claude un presupuesto de tokens orientativo para el bucle agéntico completo para ayudar al modelo a autorregularse en tareas agénticas largas.
Comprende el pensamiento adaptativo, donde Claude decide cuándo y cuánto pensar, y dirígelo con esfuerzo y prompting.
Comprende cómo funciona el pensamiento, cuándo piensa Claude de forma predeterminada y cómo interactúa el pensamiento con el esfuerzo.
Compatibility
| Supported models |
|
|---|---|
| Supported platforms |
|
Was this page helpful?