Claude Opus 5 représente une amélioration radicale par rapport à Claude Opus 4.8, avec les gains les plus importants en matière de raisonnement approfondi, de tâches agentiques et à long terme, et de mise à l'échelle du calcul au moment du test. Cette page résume toutes les nouveautés de Claude Opus 5, notamment la réflexion activée par défaut, les changements d'outils en cours de conversation et un changement incompatible concernant les cas où la réflexion peut être désactivée.
| Modèle | ID de modèle API | Description |
|---|---|---|
| Claude Opus 5 | claude-opus-5 | Pour le codage agentique complexe et le travail en entreprise |
Claude Opus 5 dispose d'une fenêtre de contexte de 1M de tokens (1M de tokens est à la fois la valeur par défaut et le maximum ; il n'existe pas de variante de contexte plus petite), de 128k tokens de sortie maximum, et de la réflexion activée par défaut.
Pour les tarifs et spécifications complets, consultez l'aperçu des modèles.
Vous pouvez ajouter ou supprimer des outils entre les tours d'une conversation tout en préservant le cache de prompts, au lieu de renvoyer une liste d'outils fixe pendant toute la durée d'une session. Les changements d'outils en cours de conversation sont en bêta : incluez l'en-tête bêta mid-conversation-tool-changes-2026-07-01 dans vos requêtes. Consultez Changements d'outils en cours de conversation pour l'utilisation.
Le paramètre fallbacks prend en charge un nouveau mode "default", qui applique les modèles de repli recommandés par Anthropic par catégorie de refus au lieu d'une liste de modèles que vous maintenez vous-même. L'ensemble du paramètre fallbacks est en bêta. Utilisez l'en-tête bêta server-side-fallback-2026-07-01, qui prend en charge à la fois le mode "default" et les listes de modèles explicites (l'en-tête antérieur server-side-fallback-2026-06-01 n'accepte que les listes explicites). Consultez Refus et repli.
La longueur minimale de prompt pouvant être mise en cache sur Claude Opus 5 est de 512 tokens, contre 1 024 tokens sur Claude Opus 4.8. Les prompts qui étaient trop courts pour être mis en cache sur Claude Opus 4.8 peuvent désormais créer des entrées de cache sans aucune modification de code. Consultez Mise en cache des prompts pour les minimums par modèle.
Le mode rapide (aperçu de recherche) est disponible pour Claude Opus 5 sur l'API Claude uniquement ; il n'est actuellement pas disponible sur Amazon Bedrock, Google Cloud ou Microsoft Foundry. Le mode rapide pour Claude Opus 5 est tarifé à 10 $ par million de tokens d'entrée et 50 $ par million de tokens de sortie. Consultez Mode rapide pour l'accès, les modèles pris en charge et les tarifs.
Sur Claude Opus 4.8, les requêtes s'exécutent sans réflexion sauf si vous définissez thinking: {"type": "adaptive"}. Sur Claude Opus 5, les mêmes requêtes s'exécutent avec la réflexion activée : le modèle décide quand et combien réfléchir à chaque tour, et le paramètre effort est le contrôle de la profondeur de réflexion. La valeur transmise est inchangée ; thinking: {"type": "adaptive"} reste valide et équivalent à la valeur par défaut.
Étant donné que max_tokens est une limite stricte sur la sortie totale (réflexion plus texte de réponse), réexaminez-le pour les charges de travail qui s'exécutaient sans réflexion sur Claude Opus 4.8.
L'API conserve l'option de désactiver la réflexion, sous réserve de la restriction d'effort ci-dessous.
Claude Opus 5 convertit l'effort supplémentaire en meilleurs résultats de manière plus fiable que tout modèle Opus antérieur, de sorte que le niveau d'effort que vous choisissez a plus de poids. L'échelle complète est disponible : low, medium, high, xhigh et max, avec max comme niveau supérieur pour le raisonnement le plus approfondi possible. Commencez par la valeur par défaut, high, et ajustez dans l'une ou l'autre direction en fonction de vos évaluations : descendez là où la qualité se maintient pour économiser des tokens et de la latence, ou montez pour le travail le plus exigeant. Lorsque vous exécutez avec un effort xhigh ou max, définissez un max_tokens élevé afin que le modèle ait de la place pour réfléchir et agir à travers les sous-agents et les appels d'outils.
Cette requête pousse l'effort au maximum jusqu'à max :
client = anthropic.Anthropic()
with client.messages.stream(
model="claude-opus-5",
max_tokens=64000,
output_config={"effort": "max"},
messages=[
{
"role": "user",
"content": "Explain why the sum of two even numbers is always even.",
}
],
) as stream:
response = stream.get_final_message()
print(response)La réflexion est activée par défaut sur Claude Opus 5, donc aucun champ thinking n'est nécessaire.
high ou inférieurSur Claude Opus 5, thinking: {"type": "disabled"} n'est accepté que lorsque le niveau d'effort est high ou inférieur. Définir thinking: {"type": "disabled"} avec un effort xhigh ou max renvoie une erreur 400. Il s'agit d'un comportement en disponibilité générale à partir de Claude Opus 5, appliqué à chaque requête, et c'est un changement incompatible par rapport à Claude Opus 4.8, où la désactivation de la réflexion était indépendante du niveau d'effort. Si vous désactivez la réflexion à des niveaux d'effort élevés aujourd'hui, soit conservez la réflexion désactivée et définissez l'effort à high ou inférieur, soit conservez le niveau d'effort et supprimez le champ thinking.
Avec la réflexion désactivée, Claude Opus 5 peut occasionnellement écrire un appel d'outil dans sa sortie texte au lieu d'émettre un bloc tool_use, ou inclure des balises XML internes dans sa réponse visible. Dans la mesure du possible, gardez la réflexion activée et contrôlez le coût en tokens avec des niveaux d'effort plus bas ; pour les intégrations qui doivent garder la réflexion désactivée, consultez Exécution avec la réflexion désactivée pour les mesures d'atténuation par prompt.
Au-delà des changements d'API ci-dessus, Claude Opus 5 se comporte différemment de Claude Opus 4.8 de manières que vous pouvez remarquer sans modifier aucun code. Les réponses destinées aux utilisateurs et les livrables écrits par défaut sont plus longs. Dans les sessions agentiques, le modèle relate sa progression à l'utilisateur plus souvent. Dans les frameworks multi-agents, il délègue plus volontiers aux sous-agents. Il vérifie également son propre travail sans qu'on le lui demande, donc supprimez les instructions de vérification héritées des modèles antérieurs (« inclure une étape de vérification finale », « utiliser un sous-agent pour vérifier ») ; elles provoquent une sur-vérification sur Claude Opus 5. Pour les modèles de prompts qui ajustent chacun de ces comportements, consultez Rédiger des prompts pour Claude Opus 5.
Par rapport à Claude Opus 4.8, Claude Opus 5 représente une amélioration radicale plutôt qu'incrémentale, et il offre une intelligence de pointe à la moitié du coût de Claude Fable 5. Les gains les plus importants concernent :
max) en meilleurs résultats.low et medium produisant une qualité solide pour une fraction des tokens et de la latence des réglages supérieurs.Pour les modèles de prompts qui tirent le meilleur parti de ces capacités, consultez Rédiger des prompts pour Claude Opus 5.
Claude Opus 5 est tarifé à 5 $ par million de tokens d'entrée et 25 $ par million de tokens de sortie, sans changement par rapport à Claude Opus 4.8.
Consultez Tarification pour la tarification complète, y compris le traitement par lots, la mise en cache des prompts et les tarifs du mode rapide.
Claude Opus 5 est disponible sur :
claude-opus-5.anthropic.claude-opus-5. Claude Opus 5 est également accessible via l'API InvokeModel sur bedrock-runtime, servie par la même infrastructure ; l'intégration Claude sur Amazon Bedrock (héritée) ne l'inclut pas dans sa table d'ID de modèles versionnés par ARN.claude-opus-5.Claude Opus 4.8 reste disponible sur toutes ces plateformes.
Pour migrer depuis Claude Opus 4.8, mettez à jour votre ID de modèle :
model = "claude-opus-4-8" # Before
model = "claude-opus-5" # AfterEnsuite, examinez les deux changements de comportement : la réflexion est activée par défaut, et la désactivation de la réflexion avec un effort xhigh ou max renvoie une erreur 400. Consultez le guide de migration pour des instructions étape par étape.
Spécifications et tarifs complets pour tous les modèles Claude actuels.
Différences comportementales et modèles de prompts spécifiques à Claude Opus 5.
Contrôlez le nombre de tokens que Claude utilise lors de ses réponses, de low à max.
Comment fonctionne la réflexion lorsqu'elle est activée par défaut, et quand elle peut être désactivée.
Donnez à Claude un budget de tokens indicatif pour rythmer son travail.
Guide pour migrer vers les derniers modèles Claude depuis les versions précédentes de Claude.
Obtenez plus de tokens de sortie par seconde des modèles Claude Opus à un tarif premium.
Was this page helpful?