Migrer vers Claude Opus 5
Migrez vers Claude Opus 5 depuis des modèles Claude antérieurs : identifiants de modèle, changements non rétrocompatibles, changements recommandés et listes de contrôle de migration.
Claude Opus 5 représente une amélioration majeure par rapport à Claude Opus 4.8, performant sur le raisonnement approfondi, les tâches agentiques et à long horizon, ainsi que sur la mise à l'échelle du calcul au moment de l'inférence (« test-time compute scaling »). Pour les différences de comportement et les modèles de prompts spécifiques au modèle, consultez Prompter Claude Opus 5.
Claude Opus 5 est une mise à niveau directe (« drop-in ») de Claude Opus 4.8 au même tarif de 5 $ USD par million de tokens d'entrée et 25 $ USD par million de tokens de sortie ; consultez Tarification de Claude. Il existe deux « breaking changes » (changements non rétrocompatibles) pour le code déjà exécuté sur Claude Opus 4.8, traités dans la section Changements non rétrocompatibles. Claude Opus 5 prend en charge le même ensemble de fonctionnalités que Claude Opus 4.8, notamment la « context window » (fenêtre de contexte) de 1M de tokens (par défaut, sans en-tête bêta), 128k tokens de sortie maximum, l'« adaptive thinking » (réflexion adaptative), le « prompt caching » (mise en cache des prompts), le traitement par lots, l'API Files, la prise en charge des PDF, la vision, ainsi que les outils côté serveur et côté client, à deux exceptions près : web fetch n'est pas disponible sur Claude Opus 5, et le Priority Tier n'est pas pris en charge sur Claude Opus 5. Consultez la page de chaque outil pour connaître la disponibilité par modèle.
Migrer vers Claude Opus 5 depuis Claude Opus 4.8
Mettre à jour le nom de votre modèle
# Migration vers Opus
model = "claude-opus-4-8" # Before
model = "claude-opus-5" # Afterclaude-opus-5 est un identifiant de modèle fixe sans suffixe de date, selon le même schéma que claude-opus-4-8 et claude-sonnet-5.
Changements non rétrocompatibles
-
Réflexion activée par défaut : Sur Claude Opus 4.8, les requêtes sans champ
thinkings'exécutent sans réflexion ; sur Claude Opus 5, les mêmes requêtes s'exécutent avec la réflexion adaptative.max_tokensreste une limite stricte sur la sortie totale, réflexion plus texte de réponse, donc réexaminez-le pour les charges de travail qui s'exécutaient sans réflexion sur Claude Opus 4.8. Les tokens de réflexion sont facturés comme des tokens de sortie même lorsque le texte de réflexion ne vous est pas renvoyé ; ainsi, bien que la tarification par token soit inchangée, une charge de travail qui s'exécutait sans réflexion sur Claude Opus 4.8 peut produire davantage de tokens de sortie par requête sur Claude Opus 5 ; consultez Contrôle des coûts. Pour conserver l'ancien comportement, passezthinking: {type: "disabled"}, sous réserve du plafond d'effort décrit au point suivant ; notez qu'avec la réflexion désactivée, le modèle peut occasionnellement émettre des appels d'outils sous forme de texte brut ou inclure des balises XML internes dans sa sortie visible ; privilégiez donc des niveaux d'effort plus faibles avec la réflexion activée lorsque vous le pouvez, et consultez Exécution avec la réflexion désactivée pour des mesures d'atténuation lorsque vous ne le pouvez pas.La forme de la réponse change en conséquence. Avec la réflexion activée, une réponse peut commencer par un ou plusieurs blocs
thinkingavant le premier bloctext, et commethinking.displayvaut par défaut"omitted"sur Claude Opus 5, ces blocs arrivent avec un champthinkingvide accompagné de leursignature. Le code qui lit la réponse par position, commecontent[0].textou un gestionnaire de flux qui traite le premier événementcontent_block_startcomme du texte, échoue sur ces réponses. Sélectionnez plutôt les blocs de contenu par leur champtype: liseztextà partir des blocs dont letypeest"text", et effectuez un branchement sur le type de bloc lors du traitement des événements de flux. Pour recevoir des résumés de réflexion lisibles au lieu d'un champthinkingvide, définissezdisplay: "summarized"; consultez Contrôler l'affichage de la réflexion.Si vous exécutez une boucle d'utilisation d'outils, renvoyez à l'API les blocs
thinkingde chaque réponse de l'assistant, complets et non modifiés, lorsque vous retournez les résultats d'outils, y compris les blocs dont le champthinkingest vide. Renvoyez le message de l'assistant tel que reçu plutôt que de filtrer ses blocs de contenu par type ou de le reconstruire : l'API rejette les blocs de réflexion modifiés, réordonnés ou partiellement supprimés avec une erreur 400. Consultez Préserver les blocs de réflexion. -
La désactivation de la réflexion est plafonnée à l'effort
high: Vous pouvez toujours désactiver la réflexion avecthinking: {type: "disabled"}, mais uniquement à un niveau d'effort dehighou inférieur. Une requête qui combinethinking: {type: "disabled"}avec un effortxhighoumaxrenvoie une erreur 400. Claude Opus 4.8 accepte cette combinaison, donc auditez les requêtes qui désactivent la réflexion avant de migrer.La vérification est appliquée à chaque requête : la configuration d'effort et de réflexion de chaque requête est validée indépendamment, de sorte qu'une requête qui élève l'effort à
xhighoumaxalors que la réflexion est désactivée est rejetée même si des requêtes antérieures de la conversation ont été acceptées.Avant (accepté sur Claude Opus 4.8, rejeté sur Claude Opus 5) :
client.messages.create( model="claude-opus-4-8", max_tokens=16000, thinking={"type": "disabled"}, output_config={"effort": "xhigh"}, messages=[{"role": "user", "content": "..."}], )Après (Claude Opus 5), soit supprimez le champ
thinkingpour réactiver la réflexion :client.messages.create( model="claude-opus-5", max_tokens=16000, output_config={"effort": "xhigh"}, # thinking is on by default messages=[{"role": "user", "content": "..."}], )soit conservez la réflexion désactivée et réduisez l'effort :
client.messages.create( model="claude-opus-5", max_tokens=16000, thinking={"type": "disabled"}, output_config={"effort": "high"}, # or "medium", "low" messages=[{"role": "user", "content": "..."}], )
Changements recommandés
Ceux-ci ne sont pas obligatoires mais amélioreront votre expérience :
-
Testez l'effort
maxpour les travaux où la capacité est critique : Claude Opus 5 prend en charge l'ensemble complet des niveaux d'effort (low,medium,high,xhigh,max). Lorsque la capacité maximale importe plus que la dépense en tokens, testez l'effortmax. Il peut apporter des gains sur les tâches les plus exigeantes, mais peut présenter des rendements décroissants liés à l'augmentation de l'utilisation de tokens et peut être sujet à une réflexion excessive sur les tâches plus simples. Si vous exécutez à l'effortxhighoumax, définissez unmax_tokensélevé afin que le modèle ait la marge nécessaire pour réfléchir et agir ; commencez à 64k tokens et ajustez à partir de là. -
Envisagez les replis automatiques : Claude Opus 5 est livré avec des classificateurs de sécurité en cybersécurité dont les refus de catégorie cyber peuvent se replier sur Claude Opus 4.8. Pour réexécuter automatiquement les requêtes refusées sur un autre modèle, envisagez le paramètre
fallbacksavec le mode"default"(fallbacks: "default"), qui sélectionne un modèle de repli recommandé en fonction de la catégorie de refus plutôt qu'une liste de modèles maintenue manuellement. Le repli côté serveur est en bêta ; le mode"default"nécessite l'en-tête bêtaserver-side-fallback-2026-07-01. Consultez Refus et repli. -
Mettez en cache des prompts plus courts : La longueur minimale de prompt pouvant être mise en cache sur Claude Opus 5 est de 512 tokens, contre 1 024 tokens sur Claude Opus 4.8. Les prompts qui étaient trop courts pour être mis en cache sur Claude Opus 4.8 peuvent désormais créer des entrées de cache, sans aucune modification de code requise. Consultez Mise en cache des prompts pour les minimums par modèle.
-
Modifiez les outils en cours de conversation (bêta) : Vous pouvez ajouter ou supprimer des outils entre les tours d'une conversation sans invalider les succès du cache de prompts sur les tours précédents. Envoyez l'en-tête bêta
mid-conversation-tool-changes-2026-07-01. Ceci est utile pour les charges de travail agentiques qui exposent les outils progressivement ou les retirent au fur et à mesure qu'une tâche avance ; sans cela, une liste d'outils modifiée invalide le préfixe mis en cache. -
Réajustez les prompts de longueur et de verbosité : Les réponses visibles par défaut et les livrables écrits sont plus longs sur Claude Opus 5 que sur Claude Opus 4.8, et réduire l'effort diminue le volume de réflexion sans raccourcir de manière fiable la réponse visible. Demandez plutôt explicitement la concision ou une longueur cible. Consultez Longueur et verbosité des réponses et Longueur des livrables écrits.
-
Supprimez les instructions de vérification héritées et limitez la portée : Claude Opus 5 vérifie son propre travail sans qu'on le lui demande ; supprimez donc les instructions explicites de vérification ou d'autocontrôle héritées de prompts ajustés pour des modèles antérieurs ; les conserver entraîne une survérification. Pour les tâches restreintes, limitez explicitement la portée de la tâche. Dans les frameworks multi-agents, donnez des indications explicites sur les scénarios qui justifient une délégation ou plafonnez le nombre de sous-agents, car Claude Opus 5 délègue plus volontiers que les modèles antérieurs. Consultez Portée des tâches et survérification et Contrôler la création de sous-agents.
Liste de contrôle de migration
- Mettez à jour le nom du modèle de
claude-opus-4-8versclaude-opus-5. - Examinez les charges de travail qui s'exécutaient sans champ
thinking: elles s'exécutent avec la réflexion sur Claude Opus 5. Réexaminezmax_tokens, qui reste une limite stricte sur la sortie totale (réflexion plus texte de réponse), ou passezthinking: {type: "disabled"}à l'efforthighou inférieur pour conserver l'ancien comportement. Si vous désactivez la réflexion, consultez Exécution avec la réflexion désactivée pour connaître les artefacts de sortie qui peuvent apparaître et leurs mesures d'atténuation par prompt. - Mettez à jour l'analyse des réponses qui lit le contenu par position, comme
content[0].textou un gestionnaire de flux qui suppose que le premier bloc de contenu est du texte : avec la réflexion activée, les blocsthinkingarrivent avant les blocstext. Sélectionnez plutôt les blocs de contenu partype. - Si vous exécutez une boucle d'utilisation d'outils, renvoyez les blocs
thinkingcomplets et non modifiés lorsque vous retournez les résultats d'outils ; les blocs modifiés renvoient une erreur 400. Consultez Préserver les blocs de réflexion. - Vérifiez que tout code qui analyse le champ
thinkingle traite uniquement comme du texte d'affichage.thinking.displayvaut par défaut"omitted"sur Claude Opus 5, comme sur Claude Opus 4.8, de sorte que les blocs de réflexion arrivent avec un champthinkingvide ; définissezdisplay: "summarized"pour recevoir des résumés lisibles. Consultez Contrôler l'affichage de la réflexion. - Auditez les requêtes qui désactivent la réflexion :
thinking: {type: "disabled"}avec un effortxhighoumaxrenvoie une erreur 400, appliquée à chaque requête. Réactivez la réflexion ou réduisez l'effort àhighou inférieur. - Réévaluez votre paramètre
effort: effectuez un nouveau balayage d'effort sur vos propres évaluations plutôt que de reprendre un paramètre ajusté pour un modèle antérieur. Les effortslowetmediumméritent d'être testés comme leviers de coût et de latence, et testez l'effortmaxlorsque la capacité maximale importe plus que la dépense en tokens. Si vous exécutez à l'effortxhighoumax, augmentezmax_tokensà au moins 64k comme point de départ. - Examinez les prompts proches du minimum de mise en cache : les prompts de 512 tokens ou plus peuvent désormais créer des entrées de cache, contre 1 024 tokens sur Claude Opus 4.8.
- Gérez
stop_reason: "refusal", et envisagezfallbacks: "default"(bêta) pour réexécuter automatiquement les requêtes refusées sur un modèle de repli recommandé. - Si votre organisation a un engagement Priority Tier, planifiez la capacité séparément : le Priority Tier n'est pas pris en charge sur Claude Opus 5, tandis que Claude Opus 4.8 le conserve.
- Pour les charges de travail agentiques, envisagez les budgets de tâche (bêta) et les modifications d'outils en cours de conversation (bêta).
- Réajustez les prompts de longueur et de verbosité : les réponses visibles par défaut et les livrables écrits sont plus longs sur Claude Opus 5, et réduire l'effort diminue le volume de réflexion sans raccourcir de manière fiable la réponse visible. Demandez explicitement la concision ou une longueur cible. Consultez Longueur et verbosité des réponses et Longueur des livrables écrits.
- Supprimez les instructions de vérification et d'autocontrôle héritées de prompts ajustés pour des modèles antérieurs (elles entraînent une survérification sur Claude Opus 5), limitez explicitement la portée des tâches pour les tâches restreintes, et dans les frameworks multi-agents, orientez ou plafonnez la délégation aux sous-agents. Consultez Portée des tâches et survérification et Contrôler la création de sous-agents.
- Réétablissez vos références de coût et de latence sur vos propres charges de travail. La tarification par token est inchangée par rapport à Claude Opus 4.8, mais les tokens de réflexion sont facturés comme des tokens de sortie, de sorte que les charges de travail qui s'exécutaient sans réflexion peuvent produire davantage de tokens de sortie par requête.
Migrer vers Claude Opus 5 depuis Claude Opus 4.7
Claude Opus 5 devrait offrir de solides performances prêtes à l'emploi sur les prompts et évaluations existants de Claude Opus 4.7, au même tarif de 5 $ USD par million de tokens d'entrée et 25 $ USD par million de tokens de sortie. Il prend en charge le même ensemble de fonctionnalités que Claude Opus 4.7, notamment la fenêtre de contexte de 1M de tokens, 128k tokens de sortie maximum, la réflexion adaptative, la mise en cache des prompts, le traitement par lots, l'API Files, la prise en charge des PDF, la vision, ainsi que les outils côté serveur et côté client, à deux exceptions près : web fetch n'est pas disponible sur Claude Opus 5, et le Priority Tier n'est pas pris en charge sur Claude Opus 5. Il ajoute également les messages système en cours de conversation et documente publiquement les détails d'arrêt en cas de refus. Sur la Claude API et Google Cloud, Claude Opus 5 prend également en charge l'utilisation de l'ordinateur sous la forme de l'ensemble d'outils stable computer_toolset_20260801 et l'outil d'utilisation du navigateur pour les tâches à l'intérieur de pages web, qu'aucun des deux Claude Opus 4.7 ne prend en charge ; les intégrations existantes sur la version antérieure computer_20251124 continuent de fonctionner sans changement sur les deux modèles. Pour mettre à niveau une intégration existante, consultez Migrer depuis computer_20251124.
Mettre à jour le nom de votre modèle
# Migration vers Opus
model = "claude-opus-4-7" # Before
model = "claude-opus-5" # AfterChangements non rétrocompatibles
-
Réflexion activée par défaut : Sur Claude Opus 4.7, les requêtes sans champ
thinkings'exécutent sans réflexion ; sur Claude Opus 5, les mêmes requêtes s'exécutent avec la réflexion adaptative.max_tokensreste une limite stricte sur la sortie totale, réflexion plus texte de réponse, donc réexaminez-le pour les charges de travail qui s'exécutaient sans réflexion sur Claude Opus 4.7. Les tokens de réflexion sont facturés comme des tokens de sortie même lorsque le texte de réflexion ne vous est pas renvoyé ; ainsi, bien que la tarification par token soit inchangée, une charge de travail qui s'exécutait sans réflexion sur Claude Opus 4.7 peut produire davantage de tokens de sortie par requête sur Claude Opus 5 ; consultez Contrôle des coûts. Pour conserver l'ancien comportement, passezthinking: {type: "disabled"}, sous réserve du plafond d'effort décrit au point suivant ; notez qu'avec la réflexion désactivée, le modèle peut occasionnellement émettre des appels d'outils sous forme de texte brut ou inclure des balises XML internes dans sa sortie visible ; privilégiez donc des niveaux d'effort plus faibles avec la réflexion activée lorsque vous le pouvez, et consultez Exécution avec la réflexion désactivée pour des mesures d'atténuation lorsque vous ne le pouvez pas.La forme de la réponse change en conséquence. Avec la réflexion activée, une réponse peut commencer par un ou plusieurs blocs
thinkingavant le premier bloctext, et commethinking.displayvaut par défaut"omitted"sur Claude Opus 5, ces blocs arrivent avec un champthinkingvide accompagné de leursignature. Le code qui lit la réponse par position, commecontent[0].textou un gestionnaire de flux qui traite le premier événementcontent_block_startcomme du texte, échoue sur ces réponses. Sélectionnez plutôt les blocs de contenu par leur champtype: liseztextà partir des blocs dont letypeest"text", et effectuez un branchement sur le type de bloc lors du traitement des événements de flux. Pour recevoir des résumés de réflexion lisibles au lieu d'un champthinkingvide, définissezdisplay: "summarized"; consultez Contrôler l'affichage de la réflexion.Si vous exécutez une boucle d'utilisation d'outils, renvoyez à l'API les blocs
thinkingde chaque réponse de l'assistant, complets et non modifiés, lorsque vous retournez les résultats d'outils, y compris les blocs dont le champthinkingest vide. Renvoyez le message de l'assistant tel que reçu plutôt que de filtrer ses blocs de contenu par type ou de le reconstruire : l'API rejette les blocs de réflexion modifiés, réordonnés ou partiellement supprimés avec une erreur 400. Consultez Préserver les blocs de réflexion. -
La désactivation de la réflexion est plafonnée à l'effort
high: Vous pouvez désactiver la réflexion avecthinking: {type: "disabled"}, mais uniquement à un niveau d'effort dehighou inférieur. Une requête qui combinethinking: {type: "disabled"}avec un effortxhighoumaxrenvoie une erreur 400. Claude Opus 4.7 accepte cette combinaison, donc auditez les requêtes qui désactivent la réflexion avant de migrer.La vérification est appliquée à chaque requête : la configuration d'effort et de réflexion de chaque requête est validée indépendamment, de sorte qu'une requête qui élève l'effort à
xhighoumaxalors que la réflexion est désactivée est rejetée même si des requêtes antérieures de la conversation ont été acceptées.Avant (accepté sur Claude Opus 4.7, rejeté sur Claude Opus 5) :
client.messages.create( model="claude-opus-4-7", max_tokens=16000, thinking={"type": "disabled"}, output_config={"effort": "xhigh"}, messages=[{"role": "user", "content": "..."}], )Après (Claude Opus 5), soit supprimez le champ
thinkingpour exécuter avec la réflexion :client.messages.create( model="claude-opus-5", max_tokens=16000, output_config={"effort": "xhigh"}, # thinking is on by default messages=[{"role": "user", "content": "..."}], )soit conservez la réflexion désactivée et réduisez l'effort :
client.messages.create( model="claude-opus-5", max_tokens=16000, thinking={"type": "disabled"}, output_config={"effort": "high"}, # or "medium", "low" messages=[{"role": "user", "content": "..."}], )
Ce qui a changé
Les éléments suivants ne sont pas des changements non rétrocompatibles ; ils décrivent des différences de comportement qu'il convient de vérifier après avoir changé l'identifiant du modèle.
-
Paramètres d'échantillonnage (inchangés) : Définir
temperature,top_poutop_kà une valeur autre que celle par défaut renvoie une erreur 400 sur Claude Opus 5, comme sur Claude Opus 4.7. La plupart des SDK définissent encore ces champs pour la compatibilité avec les modèles antérieurs, de sorte que le code qui les définit passe la vérification de types même si l'API rejette la requête. Le SDK Python (v1.0 et ultérieur) ne les définit pas, et les passer lève uneTypeError. Si vous avez supprimé ces paramètres lors de la migration vers Opus 4.7, aucune modification supplémentaire n'est nécessaire. -
L'effort par défaut est
high: La valeur par défaut du paramètre effort sur Claude Opus 5 esthighsur la Claude API et Claude Code. Si vous définissez déjà l'effort explicitement, votre paramètre est inchangé. -
Niveaux d'effort recalibrés : L'allocation de tokens derrière chaque niveau d'effort change sur Claude Opus 5 par rapport à Claude Opus 4.7, et Claude Opus 5 prend en charge l'ensemble complet des niveaux d'effort (
low,medium,high,xhigh,max). Effectuez un nouveau balayage d'effort sur vos propres évaluations plutôt que de reprendre un paramètre ajusté pour Claude Opus 4.7. Les effortslowetmediumméritent d'être testés comme leviers de coût et de latence, et testez l'effortmaxlorsque la capacité maximale importe plus que la dépense en tokens. Si vous exécutez à l'effortxhighoumax, définissez unmax_tokensélevé afin que le modèle ait la marge nécessaire pour réfléchir et agir ; commencez à 64k tokens et ajustez à partir de là. Consultez Effort. -
La fenêtre de contexte de 1M est la valeur par défaut : Claude Opus 5 sert par défaut la fenêtre de contexte complète de 1M de tokens, sans en-tête bêta et sans supplément pour contexte long. Si votre client passe un en-tête bêta de fenêtre de contexte pour la compatibilité avec des modèles plus anciens, vous pouvez le supprimer sur Claude Opus 5.
-
Messages système en cours de conversation : Claude Opus 5 accepte les messages
role: "system"immédiatement après un tour utilisateur dans le tableaumessages(sous réserve des règles de placement). Utilisez le champsystemde premier niveau pour les instructions qui s'appliquent dès le début. Claude Opus 4.7 rejetterole: "system"dansmessagesavec une erreur 400. Si vous maintenez des chemins de code qui reconstruisent l'historique complet des messages pour mettre à jour les instructions, vous pouvez les simplifier et préserver les succès du cache de prompts sur les tours précédents. -
Détails d'arrêt en cas de refus : L'objet
stop_detailssur les réponses de refus (disponible depuis Claude Opus 4.7) est désormais documenté publiquement. Lorsque le modèle décline une requête, il identifie la catégorie du refus, en plus du motif d'arrêtrefusalexistant. Aucun en-tête bêta n'est requis, et il n'y a pas de possibilité de désactivation. Consultez Gérer les motifs d'arrêt. -
Minimum de mise en cache des prompts réduit : La longueur minimale de prompt pouvant être mise en cache sur Claude Opus 5 est de 512 tokens, inférieure à celle de Claude Opus 4.7. Les prompts qui étaient trop courts pour être mis en cache sur Claude Opus 4.7 peuvent désormais créer des entrées de cache, sans aucune modification de code requise. Consultez Mise en cache des prompts pour les minimums par modèle.
-
Mode rapide : Claude Opus 5 prend en charge le mode rapide (aperçu de recherche) ; le mode rapide n'est pas disponible sur Claude Opus 4.7, où les requêtes avec
speed: "fast"renvoient une erreur. Le paramètrespeed: "fast"et l'en-tête bêtafast-mode-2026-02-01fonctionnent sans changement sur Claude Opus 5.
Changements recommandés
Ceux-ci ne sont pas obligatoires mais amélioreront votre expérience :
-
Envisagez les replis automatiques : Claude Opus 5 est livré avec des classificateurs de sécurité en cybersécurité dont les refus de catégorie cyber peuvent se replier sur Claude Opus 4.8. Pour réexécuter automatiquement les requêtes refusées sur un autre modèle, envisagez le paramètre
fallbacksavec le mode"default"(fallbacks: "default"), qui sélectionne un modèle de repli recommandé en fonction de la catégorie de refus plutôt qu'une liste de modèles maintenue manuellement. Le repli côté serveur est en bêta ; le mode"default"nécessite l'en-tête bêtaserver-side-fallback-2026-07-01. Consultez Refus et repli. -
Modifiez les outils en cours de conversation (bêta) : Vous pouvez ajouter ou supprimer des outils entre les tours d'une conversation sans invalider les succès du cache de prompts sur les tours précédents. Envoyez l'en-tête bêta
mid-conversation-tool-changes-2026-07-01. Ceci est utile pour les charges de travail agentiques qui exposent les outils progressivement ou les retirent au fur et à mesure qu'une tâche avance ; sans cela, une liste d'outils modifiée invalide le préfixe mis en cache. -
Réajustez les prompts de longueur et de verbosité : Les réponses visibles par défaut et les livrables écrits sont plus longs sur Claude Opus 5 que sur les modèles Opus antérieurs, et réduire l'effort diminue le volume de réflexion sans raccourcir de manière fiable la réponse visible. Demandez plutôt explicitement la concision ou une longueur cible. Consultez Longueur et verbosité des réponses et Longueur des livrables écrits.
-
Supprimez les instructions de vérification héritées et limitez la portée : Claude Opus 5 vérifie son propre travail sans qu'on le lui demande ; supprimez donc les instructions explicites de vérification ou d'autocontrôle héritées de prompts ajustés pour des modèles antérieurs ; les conserver entraîne une survérification. Pour les tâches restreintes, limitez explicitement la portée de la tâche. Dans les frameworks multi-agents, donnez des indications explicites sur les scénarios qui justifient une délégation ou plafonnez le nombre de sous-agents, car Claude Opus 5 délègue plus volontiers que les modèles antérieurs. Consultez Portée des tâches et survérification et Contrôler la création de sous-agents.
Liste de contrôle de migration
- Mettez à jour le nom du modèle de
claude-opus-4-7versclaude-opus-5(ou mettez à jour les alias). - Examinez les charges de travail qui s'exécutaient sans champ
thinking: elles s'exécutent avec la réflexion sur Claude Opus 5. Réexaminezmax_tokens, qui reste une limite stricte sur la sortie totale (réflexion plus texte de réponse), ou passezthinking: {type: "disabled"}à l'efforthighou inférieur pour conserver l'ancien comportement. Si vous désactivez la réflexion, consultez Exécution avec la réflexion désactivée pour connaître les artefacts de sortie qui peuvent apparaître et leurs mesures d'atténuation par prompt. - Mettez à jour l'analyse des réponses qui lit le contenu par position, comme
content[0].textou un gestionnaire de flux qui suppose que le premier bloc de contenu est du texte : avec la réflexion activée, les blocsthinkingarrivent avant les blocstext. Sélectionnez plutôt les blocs de contenu partype. - Si vous exécutez une boucle d'utilisation d'outils, renvoyez les blocs
thinkingcomplets et non modifiés lorsque vous retournez les résultats d'outils ; les blocs modifiés renvoient une erreur 400. Consultez Préserver les blocs de réflexion. - Vérifiez que tout code qui analyse le champ
thinkingle traite uniquement comme du texte d'affichage.thinking.displayvaut par défaut"omitted"sur Claude Opus 5, comme sur Claude Opus 4.7, de sorte que les blocs de réflexion arrivent avec un champthinkingvide ; définissezdisplay: "summarized"pour recevoir des résumés lisibles. Consultez Contrôler l'affichage de la réflexion. - Auditez les requêtes qui désactivent la réflexion :
thinking: {type: "disabled"}avec un effortxhighoumaxrenvoie une erreur 400, appliquée à chaque requête. Réactivez la réflexion ou réduisez l'effort àhighou inférieur. - Si vous avez supprimé les paramètres d'échantillonnage lors de la migration vers Opus 4.7, aucune action n'est nécessaire. Si vous les avez réintroduits avec un chemin de nouvelle tentative sur erreur 400, supprimez ce chemin de nouvelle tentative.
- Réévaluez votre paramètre
effort: effectuez un nouveau balayage d'effort sur vos propres évaluations plutôt que de reprendre un paramètre ajusté pour Claude Opus 4.7. Testez les effortslowetmediumcomme leviers de coût et de latence, et l'effortmaxlorsque la capacité maximale importe plus que la dépense en tokens. Si vous exécutez à l'effortxhighoumax, augmentezmax_tokensà au moins 64k comme point de départ. - Supprimez tout en-tête bêta de fenêtre de contexte. La fenêtre de contexte de 1M est la valeur par défaut sur la Claude API, Amazon Bedrock, Google Cloud et Microsoft Foundry.
- Si vous reconstruisez l'historique de conversation pour mettre à jour les instructions, envisagez de passer à un message système en cours de conversation pour préserver les succès du cache de prompts.
- Vérifiez que votre gestion des motifs d'arrêt lit
stop_detailssur les refus (disponible depuis Claude Opus 4.7 ; désormais documenté publiquement), et envisagezfallbacks: "default"(bêta) pour réexécuter automatiquement les requêtes refusées sur un modèle de repli recommandé. - Examinez les prompts proches du minimum de mise en cache : les prompts de 512 tokens ou plus peuvent désormais créer des entrées de cache.
- Si vous utilisez web fetch, prévoyez une alternative : il n'est pas disponible sur Claude Opus 5.
- Si votre organisation a un engagement Priority Tier, notez que le Priority Tier n'est pas pris en charge sur Claude Opus 5.
- Si vous utilisiez le mode rapide sur Claude Opus 4.7, aucune modification de requête n'est nécessaire au-delà de l'identifiant du modèle :
speed: "fast"et l'en-tête bêtafast-mode-2026-02-01fonctionnent sans changement sur Claude Opus 5. - Pour les charges de travail agentiques, envisagez les budgets de tâche (bêta) et les modifications d'outils en cours de conversation (bêta).
- Réajustez les prompts de longueur et de verbosité, et supprimez les instructions de vérification et d'autocontrôle héritées de prompts ajustés pour des modèles antérieurs.
- Réétablissez vos références de coût et de latence au niveau d'effort choisi. La tarification par token est inchangée par rapport à Claude Opus 4.7, mais les tokens de réflexion sont facturés comme des tokens de sortie, de sorte que les charges de travail qui s'exécutaient sans réflexion peuvent produire davantage de tokens de sortie par requête.
Migrer vers Claude Opus 5 depuis Claude Opus 4.6 et les modèles Opus antérieurs
Claude Opus 5 devrait offrir de solides performances prêtes à l'emploi sur les prompts et évaluations existants de Claude Opus 4.6 au même tarif, mais il existe quelques changements de comportement et d'API qu'il convient de connaître lors de votre migration. La plupart de ces changements ont pris effet dans Claude Opus 4.7 ; deux autres, la réflexion activée par défaut et un plafond d'effort sur la désactivation de la réflexion, prennent effet sur Claude Opus 5. Tous sont couverts dans cette section, qui est donc complète pour le code provenant directement de Claude Opus 4.6. Claude Opus 5 prend en charge le même ensemble de fonctionnalités que Claude Opus 4.6, notamment :
- Fenêtre de contexte de 1M de tokens au tarif API standard sans supplément pour contexte long
- 128k tokens de sortie maximum
- Réflexion adaptative
- Mise en cache des prompts
- Traitement par lots
- API Files
- Prise en charge des PDF
- Vision
- Outils côté serveur et côté client (bash, exécution de code, utilisation de l'ordinateur, éditeur de texte, recherche web, connecteur MCP, mémoire)
Deux exceptions : web fetch n'est pas disponible sur Claude Opus 5, et le Priority Tier n'est pas pris en charge sur Claude Opus 5. Sur la Claude API et Google Cloud, Claude Opus 5 prend également en charge l'utilisation de l'ordinateur sous la forme de l'ensemble d'outils stable computer_toolset_20260801 et l'outil d'utilisation du navigateur pour les tâches à l'intérieur de pages web, qu'aucun de Claude Opus 4.6 ou des modèles Opus antérieurs ne prend en charge ; les intégrations existantes sur la version antérieure computer_20251124 continuent de fonctionner sans changement sur Claude Opus 5. Pour mettre à niveau une intégration existante, consultez Migrer depuis computer_20251124.
Mettre à jour le nom de votre modèle
# Migration vers Opus
model = "claude-opus-4-6" # Before
model = "claude-opus-5" # AfterChangements majeurs
-
Réflexion étendue supprimée :
thinking: {type: "enabled", budget_tokens: N}n'est plus pris en charge sur Claude Opus 4.7 ou les modèles ultérieurs et renvoie une erreur 400. Passez à la réflexion adaptative (thinking: {type: "adaptive"}) et utilisez le paramètre effort pour contrôler la profondeur de réflexion. Sur Claude Opus 5, la réflexion adaptative est activée par défaut :thinking: {type: "adaptive"}est valide et équivaut à omettre entièrement le champthinking(voir le point suivant).Avant (Claude Opus 4.6) :
client.messages.create( model="claude-opus-4-6", max_tokens=16000, thinking={"type": "enabled", "budget_tokens": 10000}, messages=[{"role": "user", "content": "..."}], )Après (Claude Opus 5) :
client.messages.create( model="claude-opus-5", max_tokens=16000, thinking={"type": "adaptive"}, output_config={"effort": "high"}, # or "max", "xhigh", "medium", "low" messages=[{"role": "user", "content": "..."}], )La réflexion adaptative peut être orientée via le prompt et le paramètre effort ; consultez Choisir un niveau d'effort.
-
Réflexion activée par défaut : Sur Claude Opus 4.6 et Claude Opus 4.7, les requêtes sans champ
thinkings'exécutent sans réflexion ; sur Claude Opus 5, les mêmes requêtes s'exécutent avec la réflexion adaptative.max_tokensreste une limite stricte sur la sortie totale, réflexion plus texte de réponse, donc réexaminez-le pour les charges de travail qui s'exécutaient sans réflexion. Les tokens de réflexion sont facturés comme des tokens de sortie même lorsque le texte de réflexion ne vous est pas renvoyé ; ainsi, bien que la tarification par token soit inchangée, une charge de travail qui s'exécutait sans réflexion peut produire davantage de tokens de sortie par requête sur Claude Opus 5 ; consultez Contrôle des coûts. Pour conserver l'ancien comportement, passezthinking: {type: "disabled"}, sous réserve du plafond d'effort décrit au point suivant ; notez qu'avec la réflexion désactivée, le modèle peut occasionnellement émettre des appels d'outils sous forme de texte brut ou inclure des balises XML internes dans sa sortie visible ; préférez donc des niveaux d'effort plus faibles avec la réflexion activée lorsque vous le pouvez, et consultez Exécution avec la réflexion désactivée pour des mesures d'atténuation lorsque vous ne le pouvez pas.La forme de la réponse change en conséquence. Avec la réflexion activée, une réponse peut commencer par un ou plusieurs blocs
thinkingavant le premier bloctext, et comme le contenu de réflexion est omis par défaut sur Claude Opus 5 (point 5 de cette liste), ces blocs arrivent avec un champthinkingvide accompagné de leursignature. Le code qui lit la réponse par position, tel quecontent[0].textou un gestionnaire de flux qui traite le premier événementcontent_block_startcomme du texte, échoue sur ces réponses. Sélectionnez plutôt les blocs de contenu par leur champtype: liseztextà partir des blocs dont letypeest"text", et effectuez un branchement sur le type de bloc lors du traitement des événements de flux.Si vous exécutez une boucle d'utilisation d'outils, renvoyez à l'API les blocs
thinkingde chaque réponse de l'assistant complets et non modifiés lorsque vous retournez les résultats d'outils, y compris les blocs dont le champthinkingest vide. Renvoyez le message de l'assistant tel que reçu plutôt que de filtrer ses blocs de contenu par type ou de le reconstruire : l'API rejette les blocs de réflexion modifiés, réordonnés ou partiellement supprimés avec une erreur 400. Consultez Préserver les blocs de réflexion. -
La désactivation de la réflexion est plafonnée à l'effort
high: Vous pouvez désactiver la réflexion avecthinking: {type: "disabled"}, mais uniquement à un niveau d'effort dehighou inférieur. Une requête qui combinethinking: {type: "disabled"}avec l'effortxhighoumaxrenvoie une erreur 400 sur Claude Opus 5, appliquée à chaque requête. Auditez les requêtes qui désactivent la réflexion avant de migrer : réactivez la réflexion ou abaissez l'effort àhighou en dessous. -
Paramètres d'échantillonnage supprimés : Définir
temperature,top_poutop_kà une valeur autre que la valeur par défaut sur Claude Opus 4.7 ou les modèles ultérieurs, y compris Claude Opus 5, renvoie une erreur 400. Le SDK Python (v1.0 et versions ultérieures) ne les définit pas, et les passer lève uneTypeError. Le chemin de migration le plus sûr consiste à omettre entièrement ces paramètres des charges utiles de requête. Le prompt est la méthode recommandée pour guider le comportement du modèle sur Claude Opus 5. Si vous utilisieztemperature = 0pour le déterminisme, notez que cela n'a jamais garanti des sorties identiques sur les modèles précédents. -
Contenu de réflexion omis par défaut : Les blocs de réflexion apparaissent toujours dans le flux de réponse sur Claude Opus 4.7 et les modèles ultérieurs, mais leur champ
thinkingest vide sauf si vous y souscrivez explicitement. Il s'agit d'un changement silencieux par rapport à Claude Opus 4.6, où le comportement par défaut consistait à renvoyer un texte de réflexion résumé. Pour restaurer le contenu de réflexion résumé, définissezthinking.displaysur"summarized":thinking = { "type": "adaptive", "display": "summarized", }La valeur par défaut est
"omitted"sur Claude Opus 4.7 et les modèles ultérieurs. Si votre produit diffuse le raisonnement en streaming aux utilisateurs, la nouvelle valeur par défaut se manifeste par une longue pause avant le début de la sortie ; définissezdisplay: "summarized"pour restaurer une progression visible pendant la réflexion. Consultez Contrôler l'affichage de la réflexion pour plus de détails. -
Comptage de tokens mis à jour : Claude Opus 4.7 a introduit un nouveau tokenizer, que les modèles Opus ultérieurs, y compris Claude Opus 5, utilisent également. Il contribue à de meilleures performances sur un large éventail de tâches, et il peut utiliser environ 1x à 1,35x plus de tokens lors du traitement de texte par rapport aux modèles antérieurs à Claude Opus 4.7 (jusqu'à ~35 % de plus, selon le contenu).
/v1/messages/count_tokensrenvoie un nombre de tokens différent pour Claude Opus 5 par rapport à Claude Opus 4.6. L'efficacité en tokens peut varier selon la forme de la charge de travail.Les interventions au niveau du prompt,
task_budgeteteffortpeuvent aider à contrôler les coûts et à garantir une utilisation appropriée des tokens. Ces contrôles peuvent se faire au détriment de l'intelligence du modèle. Mettez à jour vos paramètresmax_tokenspour offrir une marge supplémentaire, y compris les déclencheurs de compaction. Claude Opus 5 fournit une « context window » (fenêtre de contexte) de 1M au tarif API standard, sans supplément pour le contexte long. -
Suppression du préremplissage (reprise d'Opus 4.6) : Le préremplissage des messages de l'assistant renvoie une erreur 400 sur Claude Opus 4.7 et les modèles ultérieurs, y compris Claude Opus 5. Utilisez plutôt les sorties structurées, des instructions dans l'invite système ou
output_config.format.
Choisir un niveau d'effort
Le paramètre effort vous permet d'ajuster l'intelligence de Claude par rapport à la dépense en tokens, en échangeant de la capacité contre une vitesse accrue et des coûts réduits. Claude Opus 5 prend en charge l'ensemble complet des niveaux d'effort et utilise high par défaut. Effectuez un nouveau balayage des niveaux d'effort sur vos propres évaluations plutôt que de reprendre un réglage ajusté pour un modèle antérieur :
max: Peut apporter des gains sur les tâches les plus exigeantes, mais peut présenter des rendements décroissants liés à l'augmentation de l'utilisation de tokens et peut être sujet à une réflexion excessive sur les tâches plus simples. Testez-le là où la capacité maximale compte plus que la dépense en tokens.xhigh: Capacité étendue pour les travaux agentiques et de codage de longue durée qui nécessitent plus de profondeur que la valeur par défaut.high: La valeur par défaut. Équilibre l'utilisation de tokens et l'intelligence pour la plupart des tâches.medium: Niveau inférieur économique par rapport à la valeur par défaut, qui mérite d'être testé comme contrôle des coûts et de la latence.low: Le plus efficace. À réserver aux tâches courtes et délimitées et aux charges de travail sensibles à la latence.
Si vous exécutez à l'effort xhigh ou max, définissez un max_tokens élevé afin que le modèle ait de la marge pour réfléchir et agir ; commencez à 64k tokens et ajustez à partir de là. L'effort est plus important pour ce modèle que pour tout Opus précédent. Expérimentez activement avec lui lors de votre mise à niveau.
Changements de comportement
Claude Opus 4.7 a introduit plusieurs différences de comportement par rapport à Claude Opus 4.6 qui ne sont pas des changements majeurs de l'API mais qui peuvent nécessiter des mises à jour de prompts ou la suppression d'échafaudages. Elles sont reprises dans Claude Opus 5, avec les ajustements notés dans cette liste.
-
La longueur des réponses varie selon le cas d'usage : Claude Opus 4.7 calibre la longueur de ses réponses en fonction de la complexité qu'il attribue à la tâche, plutôt que d'adopter par défaut une verbosité fixe. Cela signifie généralement des réponses plus courtes pour les recherches simples et beaucoup plus longues pour les analyses ouvertes.
Si votre produit dépend d'un certain style ou d'une certaine verbosité de sortie, vous devrez peut-être ajuster vos prompts. Par exemple, pour réduire la verbosité, ajoutez : « Fournis des réponses concises et ciblées. Omets le contexte non essentiel et limite les exemples au minimum. » Si vous observez des types spécifiques de sur-explication, ajoutez des instructions ciblées dans votre prompt pour les éviter.
Les exemples positifs montrant comment Claude peut communiquer avec le niveau de concision approprié ont tendance à être plus efficaces que les exemples négatifs ou les instructions indiquant au modèle ce qu'il ne doit pas faire. Sur Claude Opus 5, les réponses visibles par défaut et les livrables écrits sont plus longs que sur les modèles Opus antérieurs, et abaisser l'effort réduit le volume de réflexion sans raccourcir de manière fiable la réponse visible ; demandez explicitement la concision ou une longueur cible dans le prompt. Consultez Longueur des réponses et verbosité.
-
Suivi des instructions plus littéral : Claude Opus 4.7 interprète les prompts de manière plus littérale et explicite que Claude Opus 4.6, en particulier aux niveaux d'effort inférieurs. Il ne généralise pas silencieusement une instruction d'un élément à un autre, et il n'infère pas de demandes que vous n'avez pas formulées. L'avantage de ce littéralisme est la précision et moins de tâtonnements. Il fonctionne généralement mieux pour les cas d'usage API avec des prompts soigneusement ajustés, l'extraction structurée et les pipelines où vous souhaitez un comportement prévisible. Une revue des prompts et du harnais peut être particulièrement utile pour la migration vers Claude Opus 5.
-
Ton plus direct : Comme pour tout nouveau modèle, le style de prose sur les écrits longs peut évoluer. Claude Opus 4.7 est plus direct et affirmé, avec moins de formulations axées sur la validation et moins d'emoji que le style plus chaleureux de Claude Opus 4.6. Si votre produit repose sur une voix spécifique, réévaluez les prompts de style par rapport à la nouvelle référence.
-
Mises à jour de progression intégrées dans les traces agentiques : Claude Opus 4.7 fournit des mises à jour plus régulières et de meilleure qualité à l'utilisateur tout au long des longues traces agentiques. Si vous avez ajouté un échafaudage pour forcer des messages d'état intermédiaires (« Après chaque série de 3 appels d'outils, résume la progression »), essayez de le supprimer. Si vous constatez que la longueur ou le contenu des mises à jour destinées à l'utilisateur de Claude Opus 4.7 ne sont pas bien calibrés pour votre cas d'usage, décrivez explicitement dans le prompt à quoi ces mises à jour doivent ressembler et fournissez des exemples.
-
Création de sous-agents modifiée : Claude Opus 4.7 a tendance à créer moins de sous-agents par défaut que Claude Opus 4.6, tandis que Claude Opus 5 délègue plus volontiers à des sous-agents que les modèles antérieurs. Ce comportement peut être orienté via le prompt dans les deux sens ; donnez des indications explicites sur les cas où les sous-agents sont souhaitables, ou plafonnez le nombre de sous-agents. Consultez Contrôler la création de sous-agents.
-
Calibration de l'effort plus stricte : Changement significatif par rapport à Claude Opus 4.6, Claude Opus 4.7 respecte strictement les niveaux d'effort, en particulier dans le bas de l'échelle. À
lowetmedium, le modèle limite son travail à ce qui a été demandé plutôt que d'en faire plus que requis.C'est bénéfique pour la latence et le coût, mais sur des tâches modérément complexes exécutées à l'effort
low, il existe un certain risque de réflexion insuffisante. Si vous observez un raisonnement superficiel sur des problèmes complexes, augmentez l'effort àhighouxhighplutôt que de contourner le problème par le prompt.Si vous devez maintenir l'effort à
lowpour la latence, ajoutez des indications ciblées : « Cette tâche implique un raisonnement en plusieurs étapes. Réfléchis attentivement au problème avant de répondre. » Consultez Niveaux d'effort recommandés pour Claude Opus 4.7. -
Moins d'appels d'outils par défaut : Claude Opus 4.7 a tendance à utiliser les outils moins souvent que Claude Opus 4.6 et à recourir davantage au raisonnement. Cela produit de meilleurs résultats dans la plupart des cas.
Pour augmenter l'utilisation d'outils, augmentez le réglage d'effort. Les réglages d'effort
highouxhighmontrent une utilisation d'outils nettement plus importante dans la recherche agentique et le codage. Vous pouvez également ajuster votre prompt pour indiquer explicitement au modèle quand et comment utiliser correctement ses outils. -
Garde-fous de cybersécurité en temps réel : Nouvellement ajoutés dans Claude Opus 4.7, les requêtes impliquant des sujets interdits ou à haut risque peuvent entraîner des refus. Pour les travaux de sécurité légitimes tels que les tests d'intrusion, la recherche de vulnérabilités ou le red-teaming, postulez au Cyber Verification Program pour demander des restrictions réduites. La voie de candidature dépend de la manière dont vous accédez à Claude.
-
Prise en charge des images haute résolution : Claude Opus 4.7 est le premier modèle Claude prenant en charge les images haute résolution. La résolution d'image maximale est de 2 576 pixels sur le bord long, contre 1 568 pixels sur les modèles précédents. Cela débloque des gains sur les charges de travail fortement axées sur la vision et est particulièrement précieux pour l'utilisation de l'ordinateur, la compréhension de captures d'écran et l'analyse de documents.
La prise en charge de la haute résolution est automatique et ne nécessite aucun en-tête bêta ni activation côté client. Deux points à prévoir :
- Les images en pleine résolution peuvent utiliser jusqu'à environ 3x plus de tokens d'image que sur les modèles précédents (jusqu'à 4 784 tokens par image, contre un plafond précédent d'environ 1 600 tokens par image). Réévaluez le budget
max_tokenset les attentes de coût pour les charges de travail riches en images, ou sous-échantillonnez avant l'envoi si vous n'avez pas besoin de la fidélité supplémentaire. - Les coordonnées de pointage et de boîtes englobantes renvoyées par le modèle correspondent 1:1 aux pixels réels de l'image sur Claude Opus 4.7, donc aucune conversion de facteur d'échelle n'est requise.
Consultez Prise en charge des images haute résolution sur Claude Opus 4.7 pour plus de détails.
- Les images en pleine résolution peuvent utiliser jusqu'à environ 3x plus de tokens d'image que sur les modèles précédents (jusqu'à 4 784 tokens par image, contre un plafond précédent d'environ 1 600 tokens par image). Réévaluez le budget
Changements recommandés
Ceux-ci ne sont pas obligatoires mais amélioreront votre expérience :
-
Réévaluez
max_tokens: Comme le même texte produit un nombre de tokens plus élevé sur Claude Opus 4.7 et les modèles ultérieurs, mettez à jour vos paramètresmax_tokenspour offrir une marge supplémentaire, y compris les déclencheurs de compaction. Les interventions au niveau du prompt,task_budgeteteffortpeuvent aider à contrôler les coûts et à garantir une utilisation appropriée des tokens. -
Auditez les attentes de comptage de tokens : Tout chemin de code qui estime les tokens côté client ou suppose un ratio fixe tokens/caractères doit être retesté avec Claude Opus 5. Utilisez le point de terminaison de comptage de tokens pour vérifier.
-
Adoptez les budgets de tâche (bêta) : Claude Opus 4.7 introduit les budgets de tâche. Ces budgets vous permettent d'indiquer à Claude combien de tokens il dispose pour une boucle agentique complète, y compris la réflexion, les appels d'outils, les résultats d'outils et la sortie finale. Le modèle voit un décompte en cours et l'utilise pour prioriser le travail et terminer la tâche proprement à mesure que le budget est consommé. Pour l'utiliser, définissez l'en-tête bêta
task-budgets-2026-03-13et ajoutez ce qui suit à votre configuration de sortie :output_config = { "effort": "high", "task_budget": {"type": "tokens", "total": 128000}, }Vous devrez peut-être expérimenter différents budgets de tâche pour votre cas d'usage. Si le modèle reçoit un budget de tâche trop restrictif, il peut accomplir la tâche de manière moins approfondie, en citant son budget comme contrainte.
Pour les tâches agentiques ouvertes où la qualité compte plus que la vitesse, ne définissez pas de budget de tâche. Réservez les budgets de tâche aux charges de travail où vous avez besoin que le modèle limite son travail à une allocation de tokens. La valeur minimale d'un budget de tâche est de 20k tokens.
Un budget de tâche n'est pas un plafond strict ; c'est une suggestion dont le modèle a connaissance. Il diffère de
max_tokens:task_budget: un plafond indicatif sur l'ensemble de la boucle agentique. Le modèle le voit et l'utilise pour réguler son rythme.max_tokens: un plafond strict par requête sur les tokens générés. Il n'est pas transmis au modèle, donc le modèle n'en a pas connaissance.
Utilisez
task_budgetlorsque vous souhaitez que le modèle s'autorégule, etmax_tokenscomme plafond strict pour limiter l'utilisation. -
Définissez un
max_tokensélevé à l'effortmaxouxhigh: Si vous exécutez Claude Opus 4.7 ou un modèle ultérieur à l'effortmaxouxhigh, définissez un budget de tokens de sortie maximal élevé afin que le modèle ait de la marge pour réfléchir et agir à travers ses sous-agents et appels d'outils. Commencez à 64k tokens et ajustez à partir de là. -
Sous-échantillonnez les images si la haute résolution est inutile : Claude Opus 4.7 et les modèles ultérieurs prennent en charge des images jusqu'à 2576px / 3,75MP. Les images haute résolution utilisent plus de tokens. Si la fidélité d'image supplémentaire est inutile, sous-échantillonnez les images avant de les envoyer à Claude pour éviter une augmentation de l'utilisation de tokens. Consultez Images et vision.
-
Envisagez les replis automatiques : Claude Opus 5 est livré avec des classificateurs de sécurité en cybersécurité dont les refus de catégorie cyber peuvent se replier sur Claude Opus 4.8. Pour réexécuter automatiquement les requêtes refusées sur un autre modèle, envisagez le paramètre
fallbacksavec le mode"default"(fallbacks: "default"), qui sélectionne un modèle de repli recommandé en fonction de la catégorie de refus au lieu d'une liste de modèles maintenue manuellement. Le repli côté serveur est en bêta ; le mode"default"nécessite l'en-tête bêtaserver-side-fallback-2026-07-01. Consultez Refus et repli. -
Mettez en cache des prompts plus courts : La longueur minimale de prompt pouvant être mise en cache sur Claude Opus 5 est de 512 tokens, inférieure à celle des modèles Opus antérieurs. Les prompts qui étaient trop courts pour être mis en cache peuvent désormais créer des entrées de cache, sans aucune modification de code requise. Consultez Mise en cache des prompts pour les minimums par modèle.
-
Modifiez les outils en cours de conversation (bêta) : Vous pouvez ajouter ou supprimer des outils entre les tours d'une conversation sans invalider les succès de cache de prompts sur les tours précédents. Envoyez l'en-tête bêta
mid-conversation-tool-changes-2026-07-01. C'est utile pour les charges de travail agentiques qui exposent les outils progressivement ou les retirent à mesure qu'une tâche avance ; sans cela, une liste d'outils modifiée invalide le préfixe mis en cache. -
Supprimez les instructions de vérification héritées et limitez la portée : Claude Opus 5 vérifie son propre travail sans qu'on le lui demande, donc supprimez les instructions explicites de vérification ou d'auto-contrôle héritées de prompts ajustés pour des modèles antérieurs ; les laisser en place provoque une sur-vérification. Pour les tâches étroites, limitez explicitement la portée de la tâche. Consultez Portée de la tâche et sur-vérification.
Liste de contrôle de migration
- Mettez à jour le nom du modèle de
claude-opus-4-6versclaude-opus-5(ou mettez à jour les alias). - Supprimez
temperature,top_pettop_kdes charges utiles de requête. - Remplacez
thinking: {type: "enabled", budget_tokens: N}parthinking: {type: "adaptive"}plus le paramètre effort, ou supprimez entièrement le champthinking; la réflexion adaptative est activée par défaut sur Claude Opus 5. - Examinez les charges de travail qui s'exécutaient sans champ
thinking: elles s'exécutent avec réflexion sur Claude Opus 5. Réexaminezmax_tokens, qui reste une limite stricte sur la sortie totale (réflexion plus texte de réponse), ou passezthinking: {type: "disabled"}à l'efforthighou inférieur pour conserver l'ancien comportement. - Mettez à jour l'analyse des réponses qui lit le contenu par position, comme
content[0].textou un gestionnaire de flux qui suppose que le premier bloc de contenu est du texte : avec la réflexion activée, les blocsthinkingarrivent avant les blocstext. Sélectionnez plutôt les blocs de contenu partype. - Si vous exécutez une boucle d'utilisation d'outils, renvoyez les blocs
thinkingcomplets et non modifiés lorsque vous retournez les résultats d'outils ; les blocs modifiés renvoient une erreur 400. Consultez Préserver les blocs de réflexion. - Auditez les requêtes qui désactivent la réflexion :
thinking: {type: "disabled"}avec l'effortxhighoumaxrenvoie une erreur 400, appliquée à chaque requête. Réactivez la réflexion ou abaissez l'effort àhighou en dessous. - Supprimez tout préremplissage de message de l'assistant.
- Si votre interface affiche le contenu de réflexion, souscrivez explicitement au résumé de la réflexion.
- Réévaluez le coût et la latence de bout en bout avec la tokenisation mise à jour ; les tokens de réflexion sont facturés comme des tokens de sortie, donc les charges de travail qui s'exécutaient sans réflexion peuvent également produire davantage de tokens de sortie par requête.
- Réajustez
max_tokenspour tenir compte de la tokenisation mise à jour. - Retestez toute estimation de comptage de tokens côté client.
- Si votre application envoie des images, réévaluez le budget pour la prise en charge des images haute résolution (jusqu'à environ 3x plus de tokens d'image par image en pleine résolution). Sous-échantillonnez avant l'envoi si vous n'avez pas besoin de la fidélité supplémentaire.
- Si vous consommez des coordonnées de pointage ou de boîtes englobantes provenant du modèle, supprimez toute conversion de facteur d'échelle ; les coordonnées correspondent 1:1 aux pixels réels de l'image sur Claude Opus 4.7 et les modèles ultérieurs.
- Examinez les prompts au regard des changements de comportement (longueur des réponses, littéralisme, ton, mises à jour de progression, sous-agents, calibration de l'effort, déclenchement des outils, garde-fous cyber, gestion des images haute résolution).
- Rétablissez une référence de longueur de réponse en supprimant les prompts de contrôle de longueur existants, puis ajustez explicitement.
- Si vous utilisez l'effort
xhighoumax, augmentezmax_tokensà au moins 64k comme point de départ. - Envisagez d'adopter les budgets de tâche (bêta) et les modifications d'outils en cours de conversation (bêta) pour les flux de travail agentiques.
- Gérez
stop_reason: "refusal", et envisagezfallbacks: "default"(bêta) pour réexécuter automatiquement les requêtes refusées sur un modèle de repli recommandé. - Examinez les prompts proches du minimum de mise en cache : les prompts de 512 tokens ou plus peuvent désormais créer des entrées de cache sur Claude Opus 5.
- Si vous utilisez web fetch, prévoyez une alternative : il n'est pas disponible sur Claude Opus 5.
- Si votre organisation a un engagement Priority Tier, notez que Priority Tier n'est pas pris en charge sur Claude Opus 5.
- Supprimez les instructions de vérification et d'auto-contrôle héritées de prompts ajustés pour des modèles antérieurs ; elles provoquent une sur-vérification sur Claude Opus 5.
- Si votre produit effectue des travaux de sécurité légitimes, postulez au Cyber Verification Program pour accéder à des restrictions réduites sur le contenu cyber.
Migration depuis Claude Opus 4.5 ou antérieur
Si vous migrez depuis Claude Opus 4.5, Opus 4.1 ou un modèle antérieur directement vers Claude Opus 5, appliquez tous les changements décrits plus haut dans cette section ainsi que les changements cumulatifs suivants, qui ont pris effet entre Opus 4.5 et Opus 4.7. Si vous migrez depuis Opus 4.6, les changements décrits plus haut dans cette section sont tout ce dont vous avez besoin.
Mettez à jour le nom de votre modèle
# Migration vers Opus
model = "claude-opus-4-5" # Before
model = "claude-opus-5" # AfterChangements majeurs
-
La suppression du préremplissage est traitée dans les changements majeurs pour la migration depuis Claude Opus 4.6.
-
Guillemets des paramètres d'outils : Claude Opus 4.6 et les modèles ultérieurs peuvent produire un échappement de chaînes JSON légèrement différent dans les arguments d'appels d'outils (par exemple, une gestion différente des échappements Unicode ou de l'échappement des barres obliques). Si vous analysez l'
inputdes appels d'outils comme une chaîne brute plutôt qu'en utilisant un analyseur JSON, vérifiez votre logique d'analyse. Les analyseurs JSON standard (tels quejson.loads()ouJSON.parse()) gèrent ces différences automatiquement.
Changements recommandés
Ces changements améliorent votre expérience sur Claude Opus 4.7 et les modèles ultérieurs. Les éléments marqués (obligatoire sur Opus 4.7) étaient des recommandations facultatives au lancement d'Opus 4.6 mais sont désormais obligatoires ; les autres restent recommandés.
-
Migrez vers la réflexion adaptative (obligatoire sur Opus 4.7) :
thinking: {type: "enabled", budget_tokens: N}renvoie une erreur 400 sur Claude Opus 4.7 et les modèles ultérieurs. Passez àthinking: {type: "adaptive"}et utilisez le paramètre effort pour contrôler la profondeur de réflexion ; sur Claude Opus 5,thinking: {type: "adaptive"}équivaut à omettre le champthinking, ce qui s'exécute avec la réflexion adaptative par défaut. Consultez Réflexion.response = client.beta.messages.create( model="claude-opus-4-5", max_tokens=16000, thinking={"type": "enabled", "budget_tokens": 32000}, betas=["interleaved-thinking-2025-05-14"], messages=[{"role": "user", "content": "Your prompt here"}], )Notez que la migration passe également de
client.beta.messages.createàclient.messages.create. La réflexion adaptative et l'effort ne nécessitent ni l'espace de noms bêta du SDK ni aucun en-tête bêta. -
Supprimez l'en-tête bêta effort : Le paramètre effort ne nécessite pas d'en-tête bêta. Supprimez
betas=["effort-2025-11-24"]de vos requêtes. -
Supprimez l'en-tête bêta de streaming d'outils à granularité fine : Le streaming d'outils à granularité fine ne nécessite pas d'en-tête bêta. Supprimez
betas=["fine-grained-tool-streaming-2025-05-14"]de vos requêtes. -
Supprimez l'en-tête bêta de réflexion entrelacée : La réflexion adaptative active automatiquement la réflexion entrelacée sur Claude Opus 4.7, Opus 4.6 et Sonnet 4.6. Supprimez
betas=["interleaved-thinking-2025-05-14"]de vos requêtes. L'en-tête reste fonctionnel sur Sonnet 4.6 avec la réflexion étendue manuelle, mais le mode manuel est déprécié. -
Migrez vers output_config.format : Si vous utilisez les sorties structurées, mettez à jour
output_format={...}versoutput_config={"format": {...}}. L'API accepte toujours le paramètre dépréciéoutput_format, mais il sera supprimé dans une future version de modèle. Le SDK Python (v1.0 et versions ultérieures) n'accepte pasoutput_format={...}surclient.beta.messages.create()oucount_tokens(). L'argumentoutput_format=Modeldes assistantsparse()etstream()est inchangé.
Migration depuis Claude 4.1 ou antérieur
Si vous migrez depuis Opus 4.1 ou des modèles antérieurs directement vers Claude Opus 5, appliquez tous les changements décrits plus haut dans cette section, ainsi que les changements supplémentaires de cette sous-section.
# Depuis Opus 4.1
model = "claude-opus-4-1-20250805" # Before
model = "claude-opus-5" # After
# Depuis Sonnet 3.7
model = "claude-3-7-sonnet-20250219" # Before
model = "claude-opus-5" # AfterChangements majeurs supplémentaires
-
Supprimez les paramètres d'échantillonnage
À partir de Claude Opus 4.7, définir
temperature,top_poutop_kà une valeur autre que la valeur par défaut renvoie une erreur 400. Le SDK Python (v1.0 et versions ultérieures) ne les définit pas, et les passer lève uneTypeError. Le chemin de migration le plus sûr consiste à omettre entièrement ces paramètres des requêtes et à utiliser le prompt pour guider le comportement du modèle. Si vous utilisieztemperature = 0pour le déterminisme, notez que cela n'a jamais garanti des sorties identiques.# Avant - Ceci provoquera une erreur avec les modèles Claude 4+ response = client.messages.create( model="claude-3-7-sonnet-20250219", temperature=0.7, top_p=0.9, # Non-default sampling params return 400 on Opus 4.7 # ... ) # Après response = client.messages.create( model="claude-opus-5", # ... ) -
Mettez à jour les versions d'outils
Mettez à jour vers les dernières versions d'outils. Supprimez tout code utilisant la commande
undo_edit.# Avant tools = [{"type": "text_editor_20250124", "name": "str_replace_editor"}] # Après tools = [{"type": "text_editor_20250728", "name": "str_replace_based_edit_tool"}]- Éditeur de texte : Utilisez
text_editor_20250728etstr_replace_based_edit_tool. Consultez la documentation de l'outil éditeur de texte pour plus de détails. - Exécution de code : Passez à
code_execution_20260521. Consultez la documentation de l'outil d'exécution de code pour les instructions de migration.
- Éditeur de texte : Utilisez
-
Gérez la raison d'arrêt
refusalMettez à jour votre application pour gérer les raisons d'arrêt
refusal:response = client.messages.create(...) if response.stop_reason == "refusal": # Gérer le refus de manière appropriée pass -
Gérez la raison d'arrêt
model_context_window_exceededLes modèles Claude 4.5+ renvoient une raison d'arrêt
model_context_window_exceededlorsque la génération s'arrête parce que la limite de la fenêtre de contexte a été atteinte, plutôt que la limitemax_tokensdemandée. Mettez à jour votre application pour gérer cette nouvelle raison d'arrêt :response = client.messages.create(...) if response.stop_reason == "model_context_window_exceeded": # Gérer la limite de la fenêtre de contexte de manière appropriée pass -
Vérifiez la gestion des paramètres d'outils (sauts de ligne finaux)
Les modèles Claude 4.5+ préservent les sauts de ligne finaux dans les paramètres de chaîne des appels d'outils, qui étaient auparavant supprimés. Si vos outils reposent sur une correspondance exacte de chaînes avec les paramètres d'appels d'outils, vérifiez que votre logique gère correctement les sauts de ligne finaux.
-
Mettez à jour vos prompts pour les changements de comportement
Les modèles Claude 4+ ont un style de communication plus concis et direct et nécessitent des directives explicites. Consultez les bonnes pratiques de prompting pour des conseils d'optimisation.
Changements recommandés supplémentaires
- Supprimez les en-têtes bêta hérités : Supprimez
token-efficient-tools-2025-02-19etoutput-128k-2025-02-19. Tous les modèles Claude 4+ intègrent une utilisation d'outils économe en tokens et ces en-têtes n'ont aucun effet.
Liste de contrôle de migration (depuis Claude Opus 4.5 ou antérieur)
- Mettez à jour l'ID du modèle vers
claude-opus-5 - Appliquez tous les changements majeurs pour la migration depuis Claude Opus 4.6 (« extended thinking » (réflexion étendue) supprimée, réflexion activée par défaut, plafond d'effort pour la désactivation de la réflexion, paramètres d'échantillonnage supprimés, affichage de la réflexion omis par défaut, tokenisation mise à jour)
- CHANGEMENT MAJEUR : Supprimez les préremplissages de messages assistant (renvoie une erreur 400) ; utilisez plutôt les sorties structurées ou
output_config.format - CHANGEMENT MAJEUR sur Opus 4.7 : Remplacez
thinking: {type: "enabled", budget_tokens: N}parthinking: {type: "adaptive"}accompagné du paramètre effort (renvoie une erreur 400 sur Opus 4.7) - Vérifiez que l'analyse JSON des appels d'outils utilise un analyseur JSON standard
- Supprimez l'en-tête bêta
effort-2025-11-24(le paramètre effort ne le requiert pas) - Supprimez l'en-tête bêta
fine-grained-tool-streaming-2025-05-14 - Supprimez l'en-tête bêta
interleaved-thinking-2025-05-14(la réflexion adaptative active automatiquement la réflexion entrelacée) - Migrez
output_formatversoutput_config.format(le cas échéant) - Si vous migrez depuis Claude 4.1 ou antérieur : supprimez
temperature,top_pettop_k(les valeurs non par défaut renvoient une erreur 400 sur Opus 4.7) - Si vous migrez depuis Claude 4.1 ou antérieur : mettez à jour les versions des outils (
text_editor_20250728,code_execution_20260521) - Si vous migrez depuis Claude 4.1 ou antérieur : gérez la raison d'arrêt
refusal - Si vous migrez depuis Claude 4.1 ou antérieur : gérez la raison d'arrêt
model_context_window_exceeded - Si vous migrez depuis Claude 4.1 ou antérieur : vérifiez la gestion des paramètres de chaîne des outils pour les sauts de ligne finaux
- Si vous migrez depuis Claude 4.1 ou antérieur : supprimez les en-têtes bêta hérités (
token-efficient-tools-2025-02-19,output-128k-2025-02-19) - Examinez et mettez à jour vos prompts en suivant les bonnes pratiques de prompting
- Testez dans un environnement de développement avant le déploiement en production
Migration vers Claude Opus 5 depuis Claude Sonnet 5
Claude Opus 5 et Claude Sonnet 5 partagent la même surface d'API : les deux fonctionnent avec la réflexion adaptative activée par défaut, les deux définissent par défaut le paramètre effort sur high sur la Claude API et Claude Code, les deux offrent par défaut une « context window » (fenêtre de contexte) de 1M de tokens avec 128k tokens de sortie maximum, et aucun des deux ne prend en charge le Priority Tier. La réflexion étendue manuelle et les paramètres d'échantillonnage non par défaut renvoient une erreur 400 sur les deux modèles, tout comme le préremplissage assistant.
Mettez à jour le nom de votre modèle
model = "claude-sonnet-5" # Before
model = "claude-opus-5" # AfterCe qui a changé
-
Tarification : Claude Opus 5 est facturé 5 $ USD par million de tokens d'entrée et 25 $ USD par million de tokens de sortie. Claude Sonnet 5 est facturé 2 $ / 10 $ USD par million de tokens d'entrée/de sortie. Consultez la tarification de Claude pour la tarification complète.
-
La désactivation de la réflexion est plafonnée à l'effort
high: Sur Claude Sonnet 5,thinking: {type: "disabled"}est accepté à n'importe quel niveau d'effort. Sur Claude Opus 5, il n'est accepté qu'à un niveau d'efforthighou inférieur ; une requête qui combinethinking: {type: "disabled"}avec un effortxhighoumaxrenvoie une erreur 400, appliquée à chaque requête. Auditez les requêtes qui désactivent la réflexion avant de migrer. -
Messages système en cours de conversation : Claude Opus 5 accepte les messages
role: "system"immédiatement après un tour utilisateur dans le tableaumessages(sous réserve des règles de placement). Cette fonctionnalité n'est pas disponible sur Claude Sonnet 5. Si vous maintenez des chemins de code qui reconstruisent l'historique complet des messages pour mettre à jour les instructions, vous pouvez les simplifier et préserver les succès de la « prompt caching » (mise en cache des prompts) sur les tours précédents. -
La récupération web n'est pas disponible : L'outil de récupération web est disponible sur Claude Sonnet 5 mais pas sur Claude Opus 5.
Liste de contrôle de migration
- Mettez à jour le nom du modèle de
claude-sonnet-5versclaude-opus-5. - Auditez les requêtes qui désactivent la réflexion :
thinking: {type: "disabled"}avec un effortxhighoumaxrenvoie une erreur 400 sur Claude Opus 5. Réactivez la réflexion ou abaissez l'effort àhighou inférieur. - Si vous utilisez la récupération web, prévoyez une alternative : elle n'est pas disponible sur Claude Opus 5.
- Relancez le comptage de tokens sur Claude Opus 5 plutôt que de réutiliser les comptages mesurés sur Claude Sonnet 5, et réétablissez vos références de coût et de latence sur vos propres charges de travail ; la tarification par token diffère.
Was this page helpful?