Claude Opus 5 representa una mejora sustancial respecto a Claude Opus 4.8, con los mayores avances en razonamiento profundo, tareas agénticas y de largo horizonte, y escalado de cómputo en tiempo de inferencia. Esta página resume todas las novedades de Claude Opus 5, incluido el pensamiento activado por defecto, los cambios de herramientas a mitad de conversación y un cambio incompatible respecto a cuándo se puede desactivar el pensamiento.
| Modelo | ID del modelo en la API | Descripción |
|---|---|---|
| Claude Opus 5 | claude-opus-5 | Para programación agéntica compleja y trabajo empresarial |
Claude Opus 5 tiene una ventana de contexto de 1M de tokens (1M de tokens es tanto el valor predeterminado como el máximo; no existe una variante de contexto más pequeña), 128k tokens máximos de salida y pensamiento activado por defecto.
Para ver los precios y especificaciones completos, consulta la descripción general de los modelos.
Puedes agregar o eliminar herramientas entre turnos de una conversación mientras conservas la caché de prompts, en lugar de reenviar una lista fija de herramientas durante toda la sesión. Los cambios de herramientas a mitad de conversación están en beta: incluye el encabezado beta mid-conversation-tool-changes-2026-07-01 en tus solicitudes. Consulta Cambios de herramientas a mitad de conversación para ver cómo usarlos.
El parámetro fallbacks admite un nuevo modo "default", que aplica los modelos de respaldo recomendados por Anthropic según la categoría de rechazo, en lugar de una lista de modelos que mantienes tú mismo. Todo el parámetro fallbacks está en beta. Usa el encabezado beta server-side-fallback-2026-07-01, que admite tanto el modo "default" como listas explícitas de modelos (el encabezado anterior server-side-fallback-2026-06-01 solo acepta listas explícitas). Consulta Rechazos y respaldo.
La longitud mínima de prompt almacenable en caché en Claude Opus 5 es de 512 tokens, frente a los 1.024 tokens de Claude Opus 4.8. Los prompts que eran demasiado cortos para almacenarse en caché en Claude Opus 4.8 ahora pueden crear entradas de caché sin cambios en el código. Consulta Almacenamiento en caché de prompts para ver los mínimos por modelo.
El modo rápido (vista previa de investigación) está disponible para Claude Opus 5 únicamente en la API de Claude; actualmente no está disponible en Amazon Bedrock, Google Cloud ni Microsoft Foundry. El modo rápido para Claude Opus 5 tiene un precio de 10 USD por millón de tokens de entrada y 50 USD por millón de tokens de salida. Consulta Modo rápido para obtener información sobre acceso, modelos compatibles y precios.
En Claude Opus 4.8, las solicitudes se ejecutan sin pensamiento a menos que establezcas thinking: {"type": "adaptive"}. En Claude Opus 5, las mismas solicitudes se ejecutan con el pensamiento activado: el modelo decide cuándo y cuánto pensar en cada turno, y el parámetro de esfuerzo es el control para la profundidad del pensamiento. El valor en el protocolo no cambia; thinking: {"type": "adaptive"} sigue siendo válido y equivalente al valor predeterminado.
Dado que max_tokens es un límite estricto sobre la salida total (pensamiento más texto de respuesta), revísalo para las cargas de trabajo que se ejecutaban sin pensamiento en Claude Opus 4.8.
La API mantiene la opción de desactivar el pensamiento, sujeta a la restricción de esfuerzo que se describe a continuación.
Claude Opus 5 convierte el esfuerzo adicional en mejores resultados de forma más confiable que cualquier modelo Opus anterior, por lo que el nivel de esfuerzo que elijas tiene más peso. La escala completa está disponible: low, medium, high, xhigh y max, siendo max el nivel superior para el razonamiento más profundo posible. Comienza con el valor predeterminado, high, y ajusta en cualquier dirección según tus evaluaciones: baja el nivel donde la calidad se mantenga para ahorrar tokens y latencia, o súbelo para el trabajo más exigente. Cuando ejecutes con esfuerzo xhigh o max, establece un max_tokens grande para que el modelo tenga espacio para pensar y actuar a través de subagentes y llamadas a herramientas.
Esta solicitud sube el esfuerzo al máximo con max:
client = anthropic.Anthropic()
with client.messages.stream(
model="claude-opus-5",
max_tokens=64000,
output_config={"effort": "max"},
messages=[
{
"role": "user",
"content": "Explain why the sum of two even numbers is always even.",
}
],
) as stream:
response = stream.get_final_message()
print(response)El pensamiento está activado por defecto en Claude Opus 5, por lo que no se necesita el campo thinking.
high o inferiorEn Claude Opus 5, thinking: {"type": "disabled"} solo se acepta cuando el nivel de esfuerzo es high o inferior. Establecer thinking: {"type": "disabled"} con esfuerzo xhigh o max devuelve un error 400. Este es un comportamiento de disponibilidad general a partir de Claude Opus 5, aplicado en cada solicitud, y es un cambio incompatible respecto a Claude Opus 4.8, donde desactivar el pensamiento era independiente del nivel de esfuerzo. Si actualmente desactivas el pensamiento en niveles de esfuerzo altos, mantén el pensamiento desactivado y establece el esfuerzo en high o inferior, o bien mantén el nivel de esfuerzo y elimina el campo thinking.
Con el pensamiento desactivado, Claude Opus 5 puede ocasionalmente escribir una llamada a herramienta en su salida de texto en lugar de emitir un bloque tool_use, o incluir etiquetas XML internas en su respuesta visible. Siempre que sea posible, mantén el pensamiento activado y controla el costo de tokens con niveles de esfuerzo más bajos; para integraciones que deban mantener el pensamiento desactivado, consulta Ejecutar con el pensamiento desactivado para ver mitigaciones mediante prompts.
Más allá de los cambios de API anteriores, Claude Opus 5 se comporta de manera diferente a Claude Opus 4.8 en aspectos que puedes notar sin cambiar ningún código. Las respuestas predeterminadas dirigidas al usuario y los entregables escritos son más extensos. En sesiones agénticas, el modelo narra su progreso al usuario con más frecuencia. En frameworks multiagente, delega a subagentes con mayor facilidad. También verifica su propio trabajo sin que se le indique, así que elimina las instrucciones de verificación heredadas de modelos anteriores ("incluye un paso final de verificación", "usa un subagente para verificar"); estas causan sobreverificación en Claude Opus 5. Para ver patrones de prompts que ajustan cada uno de estos comportamientos, consulta Prompts para Claude Opus 5.
En comparación con Claude Opus 4.8, Claude Opus 5 es una mejora sustancial en lugar de incremental, y ofrece inteligencia de frontera a la mitad del costo de Claude Fable 5. Los mayores avances están en:
max) en mejores resultados.low y medium produciendo una calidad sólida con una fracción de los tokens y la latencia de los niveles más altos.Para ver los patrones de prompts que aprovechan al máximo estas capacidades, consulta Prompts para Claude Opus 5.
Claude Opus 5 tiene un precio de 5 USD por millón de tokens de entrada y 25 USD por millón de tokens de salida, sin cambios respecto a Claude Opus 4.8.
Consulta Precios para ver los precios completos, incluidas las tarifas de procesamiento por lotes, almacenamiento en caché de prompts y modo rápido.
Claude Opus 5 está disponible en:
claude-opus-5.anthropic.claude-opus-5. Claude Opus 5 también es accesible a través de la API InvokeModel en bedrock-runtime, servida por la misma infraestructura; la integración Claude en Amazon Bedrock (heredada) no lo incluye en su tabla de IDs de modelo con versión ARN.claude-opus-5.Claude Opus 4.8 sigue disponible en todas estas plataformas.
Para migrar desde Claude Opus 4.8, actualiza tu ID de modelo:
model = "claude-opus-4-8" # Before
model = "claude-opus-5" # AfterLuego revisa los dos cambios de comportamiento: el pensamiento está activado por defecto, y desactivar el pensamiento con esfuerzo xhigh o max devuelve un error 400. Consulta la guía de migración para obtener instrucciones paso a paso.
Especificaciones y precios completos de todos los modelos actuales de Claude.
Diferencias de comportamiento y patrones de prompts específicos de Claude Opus 5.
Controla cuántos tokens usa Claude al responder, desde low hasta max.
Cómo funciona el pensamiento cuando está activado por defecto y cuándo se puede desactivar.
Dale a Claude un presupuesto orientativo de tokens para que ajuste el ritmo de su trabajo.
Guía para migrar a los modelos más recientes de Claude desde versiones anteriores.
Obtén más tokens de salida por segundo de los modelos Claude Opus con precios premium.
Was this page helpful?