Claude Opus 5 es una mejora radical con respecto a Claude Opus 4.8, con las mayores ganancias en razonamiento profundo, tareas agénticas y de largo horizonte, y escalado de cómputo en tiempo de prueba. Esta página resume todo lo nuevo en Claude Opus 5, incluyendo el pensamiento activado por defecto, los cambios de herramientas a mitad de conversación y un cambio incompatible sobre cuándo se puede desactivar el pensamiento.
| Modelo | ID de modelo de API | Descripción |
|---|---|---|
| Claude Opus 5 | claude-opus-5 | Para codificación agéntica compleja y trabajo empresarial |
Claude Opus 5 tiene una ventana de contexto de 1M de tokens (1M de tokens es tanto el valor predeterminado como el máximo; no existe una variante de contexto más pequeña), 128k tokens máximos de salida y pensamiento activado por defecto.
Para ver los precios y especificaciones completos, consulta la descripción general de modelos.
Puedes agregar o eliminar herramientas entre turnos de una conversación mientras preservas la caché de prompts, en lugar de reenviar una lista fija de herramientas durante toda la sesión. Los cambios de herramientas a mitad de conversación están en beta: incluye el encabezado beta mid-conversation-tool-changes-2026-07-01 en tus solicitudes. Consulta Cambios de herramientas a mitad de conversación para conocer su uso.
El parámetro fallbacks admite un nuevo modo "default", que aplica los modelos de respaldo recomendados por Anthropic según la categoría de rechazo en lugar de una lista de modelos que mantienes tú mismo. Todo el parámetro fallbacks está en beta. Usa el encabezado beta server-side-fallback-2026-07-01, que admite tanto el modo "default" como listas explícitas de modelos (el encabezado anterior server-side-fallback-2026-06-01 acepta solo listas explícitas). Consulta Rechazos y fallback.
La longitud mínima de prompt almacenable en caché en Claude Opus 5 es de 512 tokens, por debajo de los 1,024 tokens en Claude Opus 4.8. Los prompts que eran demasiado cortos para almacenarse en caché en Claude Opus 4.8 ahora pueden crear entradas de caché sin cambios en el código. Consulta Almacenamiento en caché de prompts para ver los mínimos por modelo.
El modo rápido (vista previa de investigación) está disponible para Claude Opus 5 solo en la API de Claude; actualmente no está disponible en Amazon Bedrock, Google Cloud ni Microsoft Foundry. El modo rápido para Claude Opus 5 tiene un precio de $10 por millón de tokens de entrada y $50 por millón de tokens de salida. Consulta Modo rápido para conocer el acceso, los modelos compatibles y los precios.
En Claude Opus 4.8, las solicitudes se ejecutan sin pensamiento a menos que establezcas thinking: {"type": "adaptive"}. En Claude Opus 5, las mismas solicitudes se ejecutan con el pensamiento activado: el modelo decide cuándo y cuánto pensar en cada turno, y el parámetro effort es el control de la profundidad del pensamiento. El valor en el protocolo no cambia; thinking: {"type": "adaptive"} sigue siendo válido y equivalente al valor predeterminado.
Debido a que max_tokens es un límite estricto sobre la salida total (pensamiento más texto de respuesta), revísalo para las cargas de trabajo que se ejecutaban sin pensamiento en Claude Opus 4.8.
La API mantiene la opción de desactivar el pensamiento, sujeta a la restricción de effort que se describe a continuación.
Claude Opus 5 convierte el effort adicional en mejores resultados de manera más confiable que cualquier modelo Opus anterior, por lo que el nivel de effort que elijas tiene más peso. La escala completa está disponible: low, medium, high, xhigh y max, con max como el nivel superior para el razonamiento más profundo posible. Comienza con el valor predeterminado, high, y ajusta en cualquier dirección según tus evaluaciones: baja un nivel donde la calidad se mantenga para ahorrar tokens y latencia, o sube un nivel para el trabajo más exigente. Cuando ejecutes con effort xhigh o max, establece un max_tokens grande para que el modelo tenga espacio para pensar y actuar a través de subagentes y llamadas a herramientas.
Esta solicitud sube el effort al máximo con max:
client = anthropic.Anthropic()
with client.messages.stream(
model="claude-opus-5",
max_tokens=64000,
output_config={"effort": "max"},
messages=[
{
"role": "user",
"content": "Explain why the sum of two even numbers is always even.",
}
],
) as stream:
response = stream.get_final_message()
print(response)El pensamiento está activado por defecto en Claude Opus 5, por lo que no se necesita el campo thinking.
high o inferiorEn Claude Opus 5, thinking: {"type": "disabled"} se acepta solo cuando el nivel de effort es high o inferior. Establecer thinking: {"type": "disabled"} con effort xhigh o max devuelve un error 400. Este es un comportamiento disponible de forma general en Claude Opus 5 en adelante, se aplica en cada solicitud, y es un cambio incompatible con respecto a Claude Opus 4.8, donde desactivar el pensamiento era independiente del nivel de effort. Si hoy desactivas el pensamiento en niveles altos de effort, mantén el pensamiento desactivado y establece el effort en high o inferior, o mantén el nivel de effort y elimina el campo thinking.
Con el pensamiento desactivado, Claude Opus 5 puede ocasionalmente escribir una llamada a herramienta en su salida de texto en lugar de emitir un bloque tool_use, o incluir etiquetas XML internas en su respuesta visible. Cuando sea posible, mantén el pensamiento habilitado y controla el costo de tokens con niveles de effort más bajos; para integraciones que deben mantener el pensamiento desactivado, consulta Ejecutar con el pensamiento desactivado para conocer mitigaciones mediante prompts.
Más allá de los cambios de API anteriores, Claude Opus 5 se comporta de manera diferente a Claude Opus 4.8 en formas que puedes notar sin cambiar ningún código. Las respuestas predeterminadas dirigidas al usuario y los entregables escritos son más largos. En sesiones agénticas, el modelo narra su progreso al usuario con más frecuencia. En frameworks multiagente, delega a subagentes con mayor facilidad. También verifica su propio trabajo sin que se le indique, así que elimina las instrucciones de verificación heredadas de modelos anteriores ("incluye un paso final de verificación", "usa un subagente para verificar"); causan una verificación excesiva en Claude Opus 5. Para conocer los patrones de prompting que ajustan cada uno de estos comportamientos, consulta Prompting para Claude Opus 5.
En comparación con Claude Opus 4.8, Claude Opus 5 es una mejora radical en lugar de una incremental, y ofrece inteligencia de frontera a la mitad del costo de Claude Fable 5. Las mayores ganancias están en:
max) en mejores resultados.low y medium produciendo una calidad sólida con una fracción de los tokens y la latencia de configuraciones más altas.Para conocer los patrones de prompting que aprovechan al máximo estas capacidades, consulta Prompting para Claude Opus 5.
Claude Opus 5 tiene un precio de $5 por millón de tokens de entrada y $25 por millón de tokens de salida, sin cambios con respecto a Claude Opus 4.8.
Consulta Precios para ver los precios completos, incluyendo el procesamiento por lotes, el almacenamiento en caché de prompts y las tarifas del modo rápido.
Claude Opus 5 está disponible en:
claude-opus-5.anthropic.claude-opus-5. Claude Opus 5 también es accesible a través de la API InvokeModel en bedrock-runtime, servida por la misma infraestructura; la integración Claude en Amazon Bedrock (legado) no lo incluye en su tabla de IDs de modelo versionados por ARN.claude-opus-5.Claude Opus 4.8 sigue disponible en todas estas plataformas.
Para migrar desde Claude Opus 4.8, actualiza tu ID de modelo:
model = "claude-opus-4-8" # Before
model = "claude-opus-5" # AfterLuego revisa los dos cambios de comportamiento: el pensamiento está activado por defecto, y desactivar el pensamiento con effort xhigh o max devuelve un error 400. Consulta la guía de migración para obtener instrucciones paso a paso.
Especificaciones y precios completos de todos los modelos actuales de Claude.
Diferencias de comportamiento y patrones de prompting específicos de Claude Opus 5.
Controla cuántos tokens usa Claude al responder, desde low hasta max.
Cómo funciona el pensamiento cuando está activado por defecto, y cuándo se puede desactivar.
Dale a Claude un presupuesto de tokens orientativo para regular el ritmo de su trabajo.
Guía para migrar a los modelos más recientes de Claude desde versiones anteriores de Claude.
Obtén más tokens de salida por segundo de los modelos Claude Opus con precios premium.
Was this page helpful?