Claude Fable 5 est le modèle le plus performant d'Anthropic largement publié, disponible en disponibilité générale sur l'API Claude, Amazon Bedrock, Claude Platform on AWS, Google Cloud et Microsoft Foundry. Claude Mythos 5 partage les mêmes capacités et est proposé en disponibilité limitée aux clients approuvés dans Project Glasswing.
Les paramètres de base partagés par claude-fable-5 et claude-mythos-5 :
thinking n'est requise. thinking: {type: "disabled"} et la réflexion étendue manuelle (thinking: {type: "enabled", budget_tokens: N}) renvoient tous deux une erreur 400.invalid_request_error. Les organisations disposant d'un accord ZDR doivent contacter leur équipe de compte Anthropic pour discuter de la configuration de conservation des données. Vous pouvez également configurer la conservation des données par espace de travail. Consultez les Exigences de conservation des données spécifiques aux modèles pour les détails par plateforme.Là où les deux modèles divergent :
stop_reason: "refusal". Claude Mythos 5 n'inclut pas ces classificateurs. Consultez Refus et repli.Claude Mythos 5 est le successeur à accès restreint de Claude Mythos Preview, l'aperçu de recherche sur invitation uniquement. Claude Fable 5 est le modèle en disponibilité générale avec les mêmes capacités, et les changements de cette section s'appliquent également aux deux cibles.
La migration se fait essentiellement sans modification. Claude Mythos 5 et Claude Fable 5 utilisent la même API Messages et les mêmes schémas d'utilisation d'outils que Claude Mythos Preview, et les nombres de tokens sont à peu près inchangés car les trois modèles utilisent le même tokenizer. Les changements clés à vérifier sont les fonctionnalités qui ne sont plus disponibles (listées dans la section suivante) et la sortie de réflexion. Si vous migrez vers Claude Fable 5, prévoyez également les refus des classificateurs de sécurité, que Claude Mythos Preview et Claude Mythos 5 n'ont pas ; consultez Refus et repli.
Pour le calendrier de retrait de Claude Mythos Preview, consultez les Dépréciations de modèles.
model = "claude-mythos-preview" # Before
model = "claude-mythos-5" # After
# Ou, pour le modèle en disponibilité générale avec les mêmes capacités :
model = "claude-fable-5" # AfterRéflexion étendue et budgets de tokens de réflexion : La réflexion étendue manuelle (thinking: {type: "enabled", budget_tokens: N}) n'est pas prise en charge sur claude-mythos-5 ni sur claude-fable-5 et renvoie une erreur 400. La réflexion adaptative est toujours activée : le modèle détermine quand et combien réfléchir à chaque requête, et aucune configuration thinking n'est requise. thinking: {type: "disabled"} renvoie une erreur. budget_tokens n'a pas de remplacement direct : la réflexion est adaptative, et le paramètre effort est un contrôle distinct au niveau de la sortie, pas un budget de réflexion.
Avant (Claude Mythos Preview) :
client.messages.create(
model="claude-mythos-preview",
max_tokens=16000,
thinking={"type": "enabled", "budget_tokens": 10000},
messages=[{"role": "user", "content": "..."}],
)Après (Claude Mythos 5) :
client.messages.create(
model="claude-mythos-5",
max_tokens=16000,
messages=[{"role": "user", "content": "..."}],
)Le changement pour Claude Fable 5 est identique, avec claude-fable-5 comme nom de modèle.
Préremplissage de l'assistant : Le préremplissage du message de l'assistant n'est pas pris en charge sur claude-mythos-5 ni sur claude-fable-5 et renvoie une erreur 400, comme sur Claude Mythos Preview. Utilisez plutôt des instructions dans l'invite système.
Sortie de réflexion : Sur claude-mythos-5 et claude-fable-5, la chaîne de pensée brute n'est jamais renvoyée, mais les blocs de réflexion contiennent toujours un texte résumé lisible lorsque thinking.display est défini sur summarized. Renvoyez les blocs de réflexion inchangés lorsque vous poursuivez une conversation sur le même modèle. Consultez Sortie de réflexion sur Claude Fable 5 et Claude Mythos 5.
claude-mythos-5 et claude-fable-5 utilisent le même tokenizer que claude-mythos-preview (le tokenizer introduit avec Claude Opus 4.7). Les nombres de tokens sont à peu près inchangés lors de la migration depuis claude-mythos-preview. Par rapport aux modèles antérieurs à Claude Opus 4.7, le même contenu peut être tokenisé en environ 30 % de tokens supplémentaires, selon le contenu et la forme de la charge de travail.
/v1/messages/count_tokens renvoie des valeurs à peu près inchangées pour claude-mythos-5 et claude-fable-5 par rapport à claude-mythos-preview. Réétalonnez le coût et la latence sur vos propres charges de travail.
claude-mythos-preview vers claude-mythos-5, ou vers claude-fable-5 pour le modèle en disponibilité générale.thinking: {type: "enabled", budget_tokens: N}). La réflexion adaptative est toujours activée, et aucun champ thinking n'est requis.thinking: {type: "disabled"}. La désactivation de la réflexion renvoie une erreur sur claude-mythos-5 et claude-fable-5.budget_tokens. Il n'a pas de remplacement direct : la réflexion est adaptative, et le paramètre effort est un contrôle distinct au niveau de la sortie, pas un budget de réflexion.thinking le traite uniquement comme du texte d'affichage et renvoie les blocs de réflexion inchangés lors de la poursuite sur le même modèle. thinking.display est par défaut "omitted" sur claude-mythos-5 et claude-fable-5, comme sur Claude Mythos Preview ; définissez display: "summarized" pour recevoir des résumés lisibles. Consultez Sortie de réflexion sur Claude Fable 5 et Claude Mythos 5.thinking et redacted_thinking des tours précédents de l'assistant. Les blocs de réflexion de claude-mythos-5 et claude-fable-5 sont liés au modèle qui les a produits, et les modèles autres que Claude Fable 5 et Claude Mythos 5 les ignorent silencieusement. La suppression maintient les requêtes inter-modèles minimales et uniformes.stop_reason: "refusal" et lisez le champ stop_details.category. Claude Fable 5 exécute des classificateurs de sécurité que Claude Mythos Preview et Claude Mythos 5 n'ont pas. Consultez Refus et repli.claude-mythos-preview.Claude Fable 5 et Claude Mythos 5 utilisent la même API Messages et les mêmes schémas d'utilisation d'outils que Claude Opus 5, avec la même fenêtre de contexte de 1M de tokens par défaut et le même maximum de 128k tokens de sortie. Les restrictions de préremplissage et de paramètres d'échantillonnage, ainsi que le comportement d'affichage de la réflexion, sont repris de Claude Opus 5 sans changement. Les changements à vérifier sont la réflexion toujours activée, la tarification, le Priority Tier et la conservation des données.
model = "claude-opus-5" # Before
model = "claude-fable-5" # After
# Ou, pour le modèle Project Glasswing avec les mêmes capacités :
model = "claude-mythos-5" # AfterLa réflexion ne peut plus être désactivée : Sur Claude Opus 5, la réflexion est activée par défaut et peut être désactivée avec thinking: {type: "disabled"} à un niveau d'effort de high ou inférieur. Sur claude-fable-5 et claude-mythos-5, la réflexion adaptative est toujours activée, et thinking: {type: "disabled"} renvoie une erreur 400 à n'importe quel niveau d'effort. Supprimez la configuration thinking: {type: "disabled"} et utilisez plutôt des niveaux d'effort inférieurs pour contrôler la dépense en tokens.
Tarification : Claude Fable 5 et Claude Mythos 5 sont tarifés à 10 $ USD par million de tokens d'entrée et 50 $ USD par million de tokens de sortie, contre 5 $ USD et 25 $ USD pour Claude Opus 5. Consultez la tarification de Claude.
Priority Tier : Le Priority Tier n'est pas pris en charge sur Claude Opus 5, donc aucun trafic existant n'est affecté. Si votre organisation a un engagement Priority Tier, Claude Fable 5 le prend en charge ; Claude Mythos 5 non.
Conservation des données : Claude Fable 5 et Claude Mythos 5 exigent une conservation des données de 30 jours et ne sont pas disponibles dans le cadre d'accords de conservation zéro des données (ZDR) ; les deux sont désignés comme Covered Models. Consultez les Exigences de conservation des données spécifiques aux modèles.
claude-opus-5 vers claude-fable-5 (ou claude-mythos-5).thinking: {type: "disabled"} ; elle renvoie une erreur 400 sur claude-fable-5 et claude-mythos-5. Utilisez plutôt des niveaux d'effort inférieurs pour contrôler la dépense en tokens, et réexaminez max_tokens pour les charges de travail qui s'exécutaient avec la réflexion désactivée sur Claude Opus 5.La migration se fait essentiellement sans modification. Claude Fable 5 et Claude Mythos 5 utilisent la même API Messages et les mêmes schémas d'utilisation d'outils que Claude Opus 4.8, avec la même fenêtre de contexte de 1M de tokens par défaut et le même maximum de 128k tokens de sortie. Les nombres de tokens sont à peu près inchangés car les modèles utilisent le même tokenizer. Les changements clés à vérifier sont la réflexion adaptative toujours activée, la sortie de réflexion, les refus des classificateurs de sécurité (Claude Fable 5 uniquement) et la tarification.
model = "claude-opus-4-8" # Before
model = "claude-fable-5" # After
# Ou, pour le modèle Project Glasswing avec les mêmes capacités :
model = "claude-mythos-5" # AfterLes éléments de cette section décrivent les différences d'API et de comportement qu'il vaut la peine de vérifier après avoir remplacé l'ID du modèle. Sauf indication contraire, ils s'appliquent également à claude-fable-5 et claude-mythos-5.
La réflexion adaptative est toujours activée : La réflexion adaptative est le seul mode de réflexion sur claude-fable-5 et claude-mythos-5. Le modèle détermine quand et combien réfléchir à chaque requête, et aucune configuration thinking n'est requise. thinking: {type: "disabled"} renvoie une erreur. Utilisez le paramètre effort pour contrôler la profondeur de réflexion.
Le changement de comportement à vérifier : sur Claude Opus 4.8, les requêtes sans champ thinking s'exécutent sans réflexion ; sur claude-fable-5 et claude-mythos-5, ces mêmes requêtes s'exécutent avec la réflexion adaptative. max_tokens reste une limite stricte sur la sortie totale, réflexion plus texte de réponse, donc réexaminez-le pour les charges de travail qui s'exécutaient sans réflexion sur Claude Opus 4.8. Consultez Contrôle des coûts.
Avant (Claude Opus 4.8) :
client.messages.create(
model="claude-opus-4-8",
max_tokens=16000,
thinking={"type": "adaptive"},
output_config={"effort": "high"},
messages=[{"role": "user", "content": "..."}],
)Après (Claude Fable 5) :
client.messages.create(
model="claude-fable-5",
max_tokens=16000,
output_config={"effort": "high"},
messages=[{"role": "user", "content": "..."}],
)Le changement pour Claude Mythos 5 est identique, avec claude-mythos-5 comme nom de modèle.
Réflexion étendue et budgets de réflexion (inchangé) : La réflexion étendue manuelle (thinking: {type: "enabled", budget_tokens: N}) n'est pas prise en charge sur claude-fable-5 ni sur claude-mythos-5 et renvoie une erreur 400, comme sur Claude Opus 4.8. budget_tokens n'a pas de remplacement direct : la réflexion est adaptative, et le paramètre effort est un contrôle distinct au niveau de la sortie, pas un budget de réflexion.
Préremplissage de l'assistant (inchangé) : Le préremplissage du message de l'assistant n'est pas pris en charge sur claude-fable-5 ni sur claude-mythos-5 et renvoie une erreur 400, comme sur Claude Opus 4.8. Utilisez plutôt des instructions dans l'invite système.
Sortie de réflexion : Sur claude-fable-5 et claude-mythos-5, la chaîne de pensée brute n'est jamais renvoyée, mais les blocs de réflexion contiennent toujours un texte résumé lisible lorsque thinking.display est défini sur summarized. Renvoyez les blocs de réflexion inchangés lorsque vous poursuivez une conversation sur le même modèle. Consultez Sortie de réflexion sur Claude Fable 5 et Claude Mythos 5.
Classificateurs de sécurité et raison d'arrêt refusal (Claude Fable 5 uniquement) : claude-fable-5 exécute des classificateurs de sécurité sur les requêtes et pendant la génération de la réponse. Claude Mythos 5 n'inclut pas ces classificateurs. Lorsqu'un classificateur refuse une requête, l'API Messages renvoie stop_reason: "refusal" comme une réponse HTTP 200 réussie, pas une erreur. Le champ stop_details.category indique quel classificateur s'est déclenché, avec des catégories telles que "cyber", "bio" et "reasoning_extraction", ou null lorsque le refus ne correspond à aucune catégorie nommée. Consultez le tableau des catégories de refus pour l'ensemble complet.
Vous n'êtes pas facturé pour les tokens d'entrée d'une requête refusée avant qu'une sortie ne soit générée. Lorsqu'un classificateur se déclenche en cours de flux, l'entrée et la sortie déjà diffusée sont facturées ; ignorez la sortie partielle.
Pour réexécuter automatiquement les requêtes refusées sur un autre modèle, passez le paramètre optionnel fallbacks, qui est en bêta sur l'API Claude. Le paramètre n'est pas disponible sur l'API Message Batches ni sur Amazon Bedrock, Google Cloud et Microsoft Foundry ; sur ces trois plateformes, exécutez la nouvelle tentative côté client ou utilisez le middleware de repli sur refus du SDK. Consultez Refus et repli.
Commencez à l'effort high : La valeur par défaut du paramètre effort reste high. Sur Claude Opus 4.8, la recommandation pour le codage et le travail à haute autonomie est de définir explicitement xhigh. Sur claude-fable-5 et claude-mythos-5, utilisez high comme valeur par défaut pour la plupart des tâches et réservez xhigh aux charges de travail les plus sensibles aux capacités. Les réglages d'effort inférieurs restent performants et dépassent souvent les performances de xhigh sur les modèles précédents. Réduisez l'effort si une tâche se termine mais prend plus de temps que nécessaire. Consultez Rédiger des prompts pour Claude Fable 5.
Minimum de mise en cache des prompts plus bas : La longueur minimale de prompt pouvant être mise en cache sur claude-fable-5 et claude-mythos-5 est de 512 tokens, inférieure aux 1 024 tokens sur Claude Opus 4.8. Les prompts qui étaient trop courts pour être mis en cache sur Claude Opus 4.8 peuvent désormais créer des entrées de cache, sans modification de code requise. Consultez Mise en cache des prompts pour les minimums par modèle.
claude-fable-5 et claude-mythos-5 exigent une conservation des données de 30 jours ; sur l'API Claude, les requêtes vers claude-fable-5 qui ne répondent pas à cette exigence renvoient une erreur 400 invalid_request_error. Claude Opus 4.8 reste disponible sous ZDR. Consultez les Exigences de conservation des données spécifiques aux modèles.claude-opus-4-8 vers claude-fable-5 (ou claude-mythos-5).thinking: {type: "disabled"}. La désactivation de la réflexion renvoie une erreur sur claude-fable-5 et claude-mythos-5, et les requêtes sans champ thinking s'exécutent avec la réflexion adaptative.claude-fable-5 et claude-mythos-5.thinking le traite uniquement comme du texte d'affichage et renvoie les blocs de réflexion inchangés lors de la poursuite sur le même modèle. thinking.display est par défaut "omitted" sur claude-fable-5 et claude-mythos-5, comme sur Claude Opus 4.8 ; définissez display: "summarized" pour recevoir des résumés lisibles. Consultez Sortie de réflexion sur Claude Fable 5 et Claude Mythos 5.thinking et redacted_thinking des tours précédents de l'assistant. Les blocs de réflexion de claude-fable-5 et claude-mythos-5 sont liés au modèle qui les a produits, et les modèles autres que Claude Fable 5 et Claude Mythos 5 les ignorent silencieusement. La suppression maintient les requêtes inter-modèles minimales et uniformes. L'exception est l'utilisation d'un crédit de repli, qui nécessite que le corps de la requête soit renvoyé selon les règles exactes de cette fonctionnalité.stop_reason: "refusal" et lisez le champ stop_details.category. Pour réexécuter automatiquement les requêtes refusées sur un autre modèle, envisagez le paramètre optionnel fallbacks (bêta). Consultez Refus et repli.effort. Commencez à high pour la plupart des tâches, y compris les charges de travail qui s'exécutaient à xhigh sur Claude Opus 4.8.claude-opus-4-8 ; la tarification par token diffère.Claude Opus 5 représente une amélioration majeure par rapport à Claude Opus 4.8, performant en raisonnement approfondi, en tâches agentiques et à long horizon, et en mise à l'échelle du calcul au moment du test. Pour les différences de comportement et les schémas de prompt spécifiques au modèle, consultez Rédiger des prompts pour Claude Opus 5.
Claude Opus 5 est une mise à niveau directe de Claude Opus 4.8 à la même tarification de 5 $ par million de tokens d'entrée et 25 $ par million de tokens de sortie ; consultez la tarification de Claude. Il y a deux changements incompatibles pour le code déjà en cours d'exécution sur Claude Opus 4.8, couverts dans la section Changements incompatibles ci-dessous. Claude Opus 5 prend en charge le même ensemble de fonctionnalités que Claude Opus 4.8, y compris la fenêtre de contexte de 1M de tokens (la valeur par défaut, sans en-tête bêta), le maximum de 128k tokens de sortie, la réflexion adaptative, la mise en cache des prompts, le traitement par lots, l'API Files, la prise en charge des PDF, la vision, et les outils côté serveur et côté client, avec deux exceptions : la récupération web n'est pas disponible sur Claude Opus 5, et le Priority Tier n'est pas pris en charge sur Claude Opus 5. Consultez chaque page d'outil pour la disponibilité par modèle.
# Migration vers Opus
model = "claude-opus-4-8" # Before
model = "claude-opus-5" # Afterclaude-opus-5 est un ID de modèle fixe sans suffixe de date, le même schéma que claude-opus-4-8 et claude-sonnet-5.
Réflexion activée par défaut : Sur Claude Opus 4.8, les requêtes sans champ thinking s'exécutent sans réflexion ; sur Claude Opus 5, les mêmes requêtes s'exécutent avec la réflexion adaptative. max_tokens reste une limite stricte sur la sortie totale, réflexion plus texte de réponse, donc réexaminez-le pour les charges de travail qui s'exécutaient sans réflexion sur Claude Opus 4.8. Pour préserver l'ancien comportement, passez thinking: {type: "disabled"}, sous réserve du plafond d'effort décrit au point suivant ; notez qu'avec la réflexion désactivée, le modèle peut occasionnellement émettre des appels d'outils en texte brut ou inclure des balises XML internes dans sa sortie visible, donc préférez des niveaux d'effort inférieurs avec la réflexion activée lorsque vous le pouvez, et consultez Exécution avec la réflexion désactivée pour les mesures d'atténuation lorsque vous ne le pouvez pas.
La désactivation de la réflexion est plafonnée à l'effort high : Vous pouvez toujours désactiver la réflexion avec thinking: {type: "disabled"}, mais uniquement à un niveau d'effort de high ou inférieur. Une requête qui combine thinking: {type: "disabled"} avec un effort xhigh ou max renvoie une erreur 400. Claude Opus 4.8 accepte cette combinaison, donc auditez les requêtes qui désactivent la réflexion avant de migrer.
La vérification est appliquée à chaque requête : la configuration d'effort et de réflexion de chaque requête est validée indépendamment, donc une requête qui augmente l'effort à xhigh ou max alors que la réflexion est désactivée est rejetée même si des requêtes antérieures de la conversation ont été acceptées.
Avant (accepté sur Claude Opus 4.8, rejeté sur Claude Opus 5) :
client.messages.create(
model="claude-opus-4-8",
max_tokens=16000,
thinking={"type": "disabled"},
output_config={"effort": "xhigh"},
messages=[{"role": "user", "content": "..."}],
)Après (Claude Opus 5), soit supprimez le champ thinking pour réactiver la réflexion :
client.messages.create(
model="claude-opus-5",
max_tokens=16000,
output_config={"effort": "xhigh"}, # thinking is on by default
messages=[{"role": "user", "content": "..."}],
)soit gardez la réflexion désactivée et abaissez l'effort :
client.messages.create(
model="claude-opus-5",
max_tokens=16000,
thinking={"type": "disabled"},
output_config={"effort": "high"}, # or "medium", "low"
messages=[{"role": "user", "content": "..."}],
)Ceux-ci ne sont pas obligatoires mais amélioreront votre expérience :
Testez l'effort max pour le travail critique en matière de capacités : Claude Opus 5 prend en charge l'ensemble complet des niveaux d'effort (low, medium, high, xhigh, max). Lorsque la capacité maximale importe plus que la dépense en tokens, testez l'effort max. Il peut apporter des gains sur les tâches les plus exigeantes mais peut présenter des rendements décroissants liés à l'augmentation de l'utilisation de tokens et peut être sujet à une réflexion excessive sur les tâches plus simples. Si vous exécutez à l'effort xhigh ou max, définissez un max_tokens élevé afin que le modèle ait de la place pour réfléchir et agir ; commencez à 64k tokens et ajustez à partir de là.
Envisagez les replis automatiques : Claude Opus 5 est livré avec des classificateurs de sécurité en cybersécurité dont les refus de catégorie cyber peuvent se replier sur Claude Opus 4.8. Pour réexécuter automatiquement les requêtes refusées sur un autre modèle, envisagez le paramètre fallbacks avec le mode "default" (fallbacks: "default"), qui sélectionne un modèle de repli recommandé en fonction de la catégorie de refus au lieu d'une liste de modèles maintenue manuellement. Le repli côté serveur est en bêta ; le mode "default" nécessite l'en-tête bêta server-side-fallback-2026-07-01. Consultez Refus et repli.
Mettez en cache des prompts plus courts : La longueur minimale de prompt pouvant être mise en cache sur Claude Opus 5 est de 512 tokens, contre 1 024 tokens sur Claude Opus 4.8. Les prompts qui étaient trop courts pour être mis en cache sur Claude Opus 4.8 peuvent désormais créer des entrées de cache, sans modification de code requise. Consultez Mise en cache des prompts pour les minimums par modèle.
Modifiez les outils en cours de conversation (bêta) : Vous pouvez ajouter ou supprimer des outils entre les tours d'une conversation sans invalider les correspondances du cache de prompts sur les tours précédents. Envoyez l'en-tête bêta mid-conversation-tool-changes-2026-07-01. Ceci est utile pour les charges de travail agentiques qui exposent les outils progressivement ou les retirent à mesure qu'une tâche avance ; sans cela, une liste d'outils modifiée invalide le préfixe mis en cache.
Réajustez les prompts de longueur et de verbosité : Les réponses visibles par défaut et les livrables écrits sont plus longs sur Claude Opus 5 que sur Claude Opus 4.8, et la réduction de l'effort diminue le volume de réflexion sans raccourcir de manière fiable la réponse visible. Demandez plutôt explicitement la concision ou une longueur cible dans le prompt. Consultez Longueur et verbosité des réponses et Longueur des livrables écrits.
Supprimez les instructions de vérification héritées et limitez la portée : Claude Opus 5 vérifie son propre travail sans qu'on le lui demande, donc supprimez les instructions explicites de vérification ou d'auto-contrôle héritées de prompts ajustés pour des modèles antérieurs ; les laisser provoque une sur-vérification. Pour les tâches restreintes, limitez explicitement la portée de la tâche. Dans les frameworks multi-agents, donnez des indications explicites sur les scénarios qui justifient une délégation ou plafonnez le nombre de sous-agents, car Claude Opus 5 délègue plus volontiers que les modèles antérieurs. Consultez Portée des tâches et sur-vérification et Contrôle de la création de sous-agents.
claude-opus-4-8 vers claude-opus-5.thinking : elles s'exécutent avec la réflexion sur Claude Opus 5. Réexaminez max_tokens, qui reste une limite stricte sur la sortie totale (réflexion plus texte de réponse), ou passez thinking: {type: "disabled"} à l'effort high ou inférieur pour préserver l'ancien comportement. Si vous désactivez la réflexion, consultez Exécution avec la réflexion désactivée pour les artefacts de sortie qui peuvent apparaître et leurs mesures d'atténuation par prompt.thinking: {type: "disabled"} avec un effort xhigh ou max renvoie une erreur 400, appliquée à chaque requête. Réactivez la réflexion ou abaissez l'effort à high ou inférieur.effort : effectuez un nouveau balayage d'effort sur vos propres évaluations plutôt que de reprendre un réglage ajusté pour un modèle antérieur. Les efforts low et medium valent la peine d'être testés comme contrôles de coût et de latence, et testez l'effort max lorsque la capacité maximale importe plus que la dépense en tokens. Si vous exécutez à l'effort xhigh ou max, augmentez max_tokens à au moins 64k comme point de départ.stop_reason: "refusal", et envisagez fallbacks: "default" (bêta) pour réexécuter automatiquement les requêtes refusées sur un modèle de repli recommandé.Claude Opus 5 devrait offrir de solides performances dès le départ sur les prompts et évaluations existants de Claude Opus 4.7, au même tarif de 5 $ par million de tokens d'entrée et 25 $ par million de tokens de sortie. Il prend en charge le même ensemble de fonctionnalités que Claude Opus 4.7, y compris la fenêtre de contexte de 1M de tokens, 128k tokens de sortie maximum, la réflexion adaptative, la mise en cache des prompts, le traitement par lots, l'API Files, la prise en charge des PDF, la vision, et les outils côté serveur et côté client, avec deux exceptions : la récupération web n'est pas disponible sur Claude Opus 5, et le Priority Tier n'est pas pris en charge sur Claude Opus 5. Il ajoute également les messages système en milieu de conversation et documente publiquement les détails d'arrêt de refus.
# Migration vers Opus
model = "claude-opus-4-7" # Before
model = "claude-opus-5" # AfterRéflexion activée par défaut : Sur Claude Opus 4.7, les requêtes sans champ thinking s'exécutent sans réflexion ; sur Claude Opus 5, les mêmes requêtes s'exécutent avec la réflexion adaptative. max_tokens reste une limite stricte sur la sortie totale, réflexion plus texte de réponse, donc réexaminez-le pour les charges de travail qui s'exécutaient sans réflexion sur Claude Opus 4.7. Pour préserver l'ancien comportement, passez thinking: {type: "disabled"}, sous réserve du plafond d'effort décrit au point suivant ; notez qu'avec la réflexion désactivée, le modèle peut occasionnellement émettre des appels d'outils sous forme de texte brut ou inclure des balises XML internes dans sa sortie visible, donc préférez des niveaux d'effort plus bas avec la réflexion activée lorsque vous le pouvez, et consultez Exécution avec la réflexion désactivée pour les mesures d'atténuation lorsque vous ne le pouvez pas.
La désactivation de la réflexion est plafonnée à l'effort high : Vous pouvez désactiver la réflexion avec thinking: {type: "disabled"}, mais uniquement à un niveau d'effort de high ou inférieur. Une requête qui combine thinking: {type: "disabled"} avec un effort xhigh ou max renvoie une erreur 400. Claude Opus 4.7 accepte cette combinaison, donc auditez les requêtes qui désactivent la réflexion avant de migrer.
La vérification est appliquée à chaque requête : la configuration d'effort et de réflexion de chaque requête est validée indépendamment, donc une requête qui augmente l'effort à xhigh ou max alors que la réflexion est désactivée est rejetée même si des requêtes antérieures de la conversation ont été acceptées.
Avant (accepté sur Claude Opus 4.7, rejeté sur Claude Opus 5) :
client.messages.create(
model="claude-opus-4-7",
max_tokens=16000,
thinking={"type": "disabled"},
output_config={"effort": "xhigh"},
messages=[{"role": "user", "content": "..."}],
)Après (Claude Opus 5), soit supprimez le champ thinking pour exécuter avec la réflexion :
client.messages.create(
model="claude-opus-5",
max_tokens=16000,
output_config={"effort": "xhigh"}, # thinking is on by default
messages=[{"role": "user", "content": "..."}],
)soit gardez la réflexion désactivée et abaissez l'effort :
client.messages.create(
model="claude-opus-5",
max_tokens=16000,
thinking={"type": "disabled"},
output_config={"effort": "high"}, # or "medium", "low"
messages=[{"role": "user", "content": "..."}],
)Les éléments suivants ne sont pas des changements incompatibles ; ils décrivent des différences de comportement qu'il vaut la peine de vérifier après avoir remplacé l'ID du modèle.
Paramètres d'échantillonnage (inchangé) : Définir temperature, top_p ou top_k à une valeur non par défaut renvoie une erreur 400 sur Claude Opus 5, comme sur Claude Opus 4.7. Les types de requête du SDK définissent toujours ces champs pour la compatibilité avec les modèles antérieurs, donc le code qui les définit passe la vérification de types, mais l'API rejette la requête côté serveur. Si vous avez supprimé ces paramètres lors de la migration vers Opus 4.7, aucun autre changement n'est nécessaire.
L'effort par défaut est high : La valeur par défaut du paramètre effort sur Claude Opus 5 est high sur l'API Claude et Claude Code. Si vous définissez déjà l'effort explicitement, votre réglage est inchangé.
Niveaux d'effort recalibrés : L'allocation de tokens derrière chaque niveau d'effort change sur Claude Opus 5 par rapport à Claude Opus 4.7, et Claude Opus 5 prend en charge l'ensemble complet des niveaux d'effort (low, medium, high, xhigh, max). Effectuez un nouveau balayage d'effort sur vos propres évaluations plutôt que de reprendre un réglage ajusté pour Claude Opus 4.7. Les efforts low et medium valent la peine d'être testés comme contrôles de coût et de latence, et testez l'effort max lorsque la capacité maximale importe plus que la dépense en tokens. Si vous exécutez à l'effort xhigh ou max, définissez un max_tokens élevé pour que le modèle ait de la place pour réfléchir et agir ; commencez à 64k tokens et ajustez à partir de là. Consultez Effort.
La fenêtre de contexte de 1M est la valeur par défaut : Claude Opus 5 sert la fenêtre de contexte complète de 1M de tokens par défaut, sans en-tête bêta et sans supplément pour contexte long. Si votre client passe un en-tête bêta de fenêtre de contexte pour la compatibilité avec des modèles plus anciens, vous pouvez le supprimer sur Claude Opus 5.
Messages système en milieu de conversation : Claude Opus 5 accepte les messages role: "system" immédiatement après un tour utilisateur dans le tableau messages (sous réserve des règles de placement). Utilisez le champ system de niveau supérieur pour les instructions qui s'appliquent dès le début. Claude Opus 4.7 rejette role: "system" dans messages avec une erreur 400. Si vous maintenez des chemins de code qui reconstruisent l'historique complet des messages pour mettre à jour les instructions, vous pouvez les simplifier et préserver les correspondances du cache de prompts sur les tours antérieurs.
Détails d'arrêt de refus : L'objet stop_details sur les réponses de refus (disponible depuis Claude Opus 4.7) est désormais documenté publiquement. Lorsque le modèle décline une requête, il identifie la catégorie de refus, en plus de la raison d'arrêt refusal existante. Aucun en-tête bêta n'est requis, et il n'y a pas de possibilité de désactivation. Consultez Gestion des raisons d'arrêt.
Minimum de mise en cache des prompts abaissé : La longueur minimale de prompt pouvant être mise en cache sur Claude Opus 5 est de 512 tokens, inférieure à celle de Claude Opus 4.7. Les prompts qui étaient trop courts pour être mis en cache sur Claude Opus 4.7 peuvent désormais créer des entrées de cache, sans modification de code requise. Consultez Mise en cache des prompts pour les minimums par modèle.
Ceux-ci ne sont pas obligatoires mais amélioreront votre expérience :
Envisagez les replis automatiques : Claude Opus 5 est livré avec des classificateurs de sécurité en cybersécurité dont les refus de catégorie cyber peuvent se replier sur Claude Opus 4.8. Pour réexécuter automatiquement les requêtes refusées sur un autre modèle, envisagez le paramètre fallbacks avec le mode "default" (fallbacks: "default"), qui sélectionne un modèle de repli recommandé en fonction de la catégorie de refus au lieu d'une liste de modèles maintenue manuellement. Le repli côté serveur est en bêta ; le mode "default" nécessite l'en-tête bêta server-side-fallback-2026-07-01. Consultez Refus et repli.
Modifiez les outils en milieu de conversation (bêta) : Vous pouvez ajouter ou supprimer des outils entre les tours d'une conversation sans invalider les correspondances du cache de prompts sur les tours antérieurs. Envoyez l'en-tête bêta mid-conversation-tool-changes-2026-07-01. Ceci est utile pour les charges de travail agentiques qui exposent les outils progressivement ou les retirent à mesure qu'une tâche avance ; sans cela, une liste d'outils modifiée invalide le préfixe mis en cache.
Réajustez les prompts de longueur et de verbosité : Les réponses visibles par défaut et les livrables écrits sont plus longs sur Claude Opus 5 que sur les modèles Opus antérieurs, et abaisser l'effort réduit le volume de réflexion sans raccourcir de manière fiable la réponse visible. Demandez plutôt explicitement de la concision ou une longueur cible dans le prompt. Consultez Longueur et verbosité des réponses et Longueur des livrables écrits.
Supprimez les instructions de vérification héritées et limitez la portée : Claude Opus 5 vérifie son propre travail sans qu'on le lui demande, donc supprimez les instructions explicites de vérification ou d'auto-contrôle héritées de prompts ajustés pour des modèles antérieurs ; les laisser provoque une sur-vérification. Pour les tâches restreintes, limitez explicitement la portée de la tâche. Dans les frameworks multi-agents, donnez des directives explicites sur les scénarios qui justifient une délégation ou plafonnez le nombre de sous-agents, car Claude Opus 5 délègue plus facilement que les modèles antérieurs. Consultez Portée des tâches et sur-vérification et Contrôle de la création de sous-agents.
claude-opus-4-7 vers claude-opus-5 (ou mettez à jour les alias).thinking : elles s'exécutent avec la réflexion sur Claude Opus 5. Réexaminez max_tokens, qui reste une limite stricte sur la sortie totale (réflexion plus texte de réponse), ou passez thinking: {type: "disabled"} à l'effort high ou inférieur pour préserver l'ancien comportement. Si vous désactivez la réflexion, consultez Exécution avec la réflexion désactivée pour les artefacts de sortie qui peuvent apparaître et leurs mesures d'atténuation par prompt.thinking: {type: "disabled"} avec un effort xhigh ou max renvoie une erreur 400, appliquée à chaque requête. Réactivez la réflexion ou abaissez l'effort à high ou inférieur.effort : effectuez un nouveau balayage d'effort sur vos propres évaluations plutôt que de reprendre un réglage ajusté pour Claude Opus 4.7. Testez les efforts low et medium comme contrôles de coût et de latence, et l'effort max lorsque la capacité maximale importe plus que la dépense en tokens. Si vous exécutez à l'effort xhigh ou max, augmentez max_tokens à au moins 64k comme point de départ.stop_details sur les refus (disponible depuis Claude Opus 4.7 ; désormais documenté publiquement), et envisagez fallbacks: "default" (bêta) pour réexécuter automatiquement les requêtes refusées sur un modèle de repli recommandé.Claude Opus 5 devrait offrir de solides performances prêtes à l'emploi sur les prompts et évaluations existants de Claude Opus 4.6 au même tarif, mais il existe une poignée de changements comportementaux et d'API qu'il est utile de connaître lors de votre migration. La plupart de ces changements ont pris effet avec Claude Opus 4.7 ; deux autres, la réflexion activée par défaut et un plafond d'effort pour la désactivation de la réflexion, prennent effet avec Claude Opus 5. Tous sont couverts ci-dessous, donc cette section est complète pour le code provenant directement de Claude Opus 4.6. Claude Opus 5 prend en charge le même ensemble de fonctionnalités que Claude Opus 4.6, notamment :
Deux exceptions : web fetch n'est pas disponible sur Claude Opus 5, et le Priority Tier n'est pas pris en charge sur Claude Opus 5.
# Migration vers Opus
model = "claude-opus-4-6" # Before
model = "claude-opus-5" # AfterRéflexion étendue supprimée : thinking: {type: "enabled", budget_tokens: N} n'est plus pris en charge sur Claude Opus 4.7 ou les modèles ultérieurs et renvoie une erreur 400. Passez à la réflexion adaptative (thinking: {type: "adaptive"}) et utilisez le paramètre effort pour contrôler la profondeur de réflexion. Sur Claude Opus 5, la réflexion adaptative est activée par défaut : thinking: {type: "adaptive"} est valide et équivalent à l'omission complète du champ thinking (voir le point suivant).
Avant (Claude Opus 4.6) :
client.messages.create(
model="claude-opus-4-6",
max_tokens=16000,
thinking={"type": "enabled", "budget_tokens": 10000},
messages=[{"role": "user", "content": "..."}],
)Après (Claude Opus 5) :
client.messages.create(
model="claude-opus-5",
max_tokens=16000,
thinking={"type": "adaptive"},
output_config={"effort": "high"}, # or "max", "xhigh", "medium", "low"
messages=[{"role": "user", "content": "..."}],
)La réflexion adaptative est orientable via le prompting et le paramètre effort ; consultez Choisir un niveau d'effort.
Réflexion activée par défaut : Sur Claude Opus 4.6 et Claude Opus 4.7, les requêtes sans champ thinking s'exécutent sans réflexion ; sur Claude Opus 5, les mêmes requêtes s'exécutent avec la réflexion adaptative. max_tokens reste une limite stricte sur la sortie totale, réflexion plus texte de réponse, donc réexaminez-le pour les charges de travail qui s'exécutaient sans réflexion. Pour préserver l'ancien comportement, passez thinking: {type: "disabled"}, sous réserve du plafond d'effort décrit au point suivant ; notez qu'avec la réflexion désactivée, le modèle peut occasionnellement émettre des appels d'outils sous forme de texte brut ou inclure des balises XML internes dans sa sortie visible, donc préférez des niveaux d'effort plus bas avec la réflexion activée lorsque c'est possible, et consultez Exécution avec la réflexion désactivée pour les mesures d'atténuation lorsque ce n'est pas possible.
La désactivation de la réflexion est plafonnée à l'effort high : Vous pouvez désactiver la réflexion avec thinking: {type: "disabled"}, mais uniquement à un niveau d'effort de high ou inférieur. Une requête qui combine thinking: {type: "disabled"} avec un effort xhigh ou max renvoie une erreur 400 sur Claude Opus 5, appliquée à chaque requête. Auditez les requêtes qui désactivent la réflexion avant de migrer : réactivez la réflexion ou abaissez l'effort à high ou en dessous.
Paramètres d'échantillonnage supprimés : Définir temperature, top_p ou top_k à une valeur non par défaut sur Claude Opus 4.7 ou les modèles ultérieurs, y compris Claude Opus 5, renvoie une erreur 400. Le chemin de migration le plus sûr consiste à omettre entièrement ces paramètres des charges utiles de requête. Le prompting est la méthode recommandée pour guider le comportement du modèle sur Claude Opus 5. Si vous utilisiez temperature = 0 pour le déterminisme, notez que cela n'a jamais garanti des sorties identiques sur les modèles précédents.
Contenu de réflexion omis par défaut : Les blocs de réflexion apparaissent toujours dans le flux de réponse sur Claude Opus 4.7 et les modèles ultérieurs, mais leur champ thinking est vide sauf si vous l'activez explicitement. Il s'agit d'un changement silencieux par rapport à Claude Opus 4.6, où le comportement par défaut était de renvoyer le texte de réflexion résumé. Pour restaurer le contenu de réflexion résumé, définissez thinking.display sur "summarized" :
thinking = {
"type": "adaptive",
"display": "summarized",
}La valeur par défaut est "omitted" sur Claude Opus 4.7 et les modèles ultérieurs. Si votre produit diffuse le raisonnement aux utilisateurs en streaming, le nouveau comportement par défaut apparaît comme une longue pause avant le début de la sortie ; définissez display: "summarized" pour restaurer la progression visible pendant la réflexion. Consultez Contrôler l'affichage de la réflexion pour plus de détails.
Comptage de tokens mis à jour : Claude Opus 4.7 a introduit un nouveau tokenizer, que les modèles Opus ultérieurs, y compris Claude Opus 5, utilisent également. Il contribue à l'amélioration des performances sur un large éventail de tâches, et il peut utiliser environ 1x à 1,35x plus de tokens lors du traitement de texte par rapport aux modèles antérieurs à Claude Opus 4.7 (jusqu'à ~35 % de plus, selon le contenu).
/v1/messages/count_tokens renvoie un nombre de tokens différent pour Claude Opus 5 par rapport à Claude Opus 4.6. L'efficacité en tokens peut varier selon la forme de la charge de travail.
Les interventions de prompting, task_budget et effort peuvent aider à contrôler les coûts et à garantir une utilisation appropriée des tokens. Ces contrôles peuvent se faire au détriment de l'intelligence du modèle. Mettez à jour vos paramètres max_tokens pour offrir une marge supplémentaire, y compris les déclencheurs de compactage. Claude Opus 5 fournit une fenêtre de contexte de 1M au tarif API standard sans supplément pour contexte long.
Suppression du prefill (reprise d'Opus 4.6) : Le préremplissage des messages assistant renvoie une erreur 400 sur Claude Opus 4.7 et les modèles ultérieurs, y compris Claude Opus 5. Utilisez plutôt les sorties structurées, des instructions dans l'invite système, ou output_config.format.
Le paramètre effort vous permet d'ajuster l'intelligence de Claude par rapport à la dépense en tokens, en échangeant de la capacité contre une vitesse plus rapide et des coûts plus faibles. Claude Opus 5 prend en charge l'ensemble complet des niveaux d'effort et utilise high par défaut. Effectuez un nouveau balayage des niveaux d'effort sur vos propres évaluations plutôt que de reprendre un réglage ajusté pour un modèle antérieur :
max : Peut apporter des gains sur les tâches les plus exigeantes mais peut présenter des rendements décroissants liés à l'augmentation de l'utilisation de tokens et peut être sujet à une sur-réflexion sur les tâches plus simples. Testez-le là où la capacité maximale compte plus que la dépense en tokens.xhigh : Capacité étendue pour le travail agentique et de codage de longue durée qui nécessite plus de profondeur que le réglage par défaut.high : La valeur par défaut. Équilibre l'utilisation de tokens et l'intelligence pour la plupart des tâches.medium : Réduction économique par rapport à la valeur par défaut, à tester comme contrôle des coûts et de la latence.low : Le plus efficace. À réserver aux tâches courtes et délimitées et aux charges de travail sensibles à la latence.Si vous exécutez à l'effort xhigh ou max, définissez un max_tokens élevé pour que le modèle ait de la place pour réfléchir et agir ; commencez à 64k tokens et ajustez à partir de là. L'effort est plus important pour ce modèle que pour tout Opus précédent. Expérimentez activement avec lui lors de votre mise à niveau.
Claude Opus 4.7 a introduit plusieurs différences comportementales par rapport à Claude Opus 4.6 qui ne sont pas des changements incompatibles de l'API mais peuvent nécessiter des mises à jour de prompts ou la suppression d'échafaudages. Elles se poursuivent sur Claude Opus 5, avec les ajustements notés ci-dessous.
La longueur des réponses varie selon le cas d'usage : Claude Opus 4.7 calibre la longueur de la réponse en fonction de la complexité qu'il attribue à la tâche, plutôt que d'adopter par défaut une verbosité fixe. Cela signifie généralement des réponses plus courtes pour les recherches simples et beaucoup plus longues pour les analyses ouvertes.
Si votre produit dépend d'un certain style ou d'une certaine verbosité de sortie, vous devrez peut-être ajuster vos prompts. Par exemple, pour diminuer la verbosité, ajoutez : « Fournissez des réponses concises et ciblées. Omettez le contexte non essentiel et limitez les exemples au minimum. » Si vous observez des types spécifiques de sur-explication, ajoutez des instructions ciblées dans votre prompt pour les éviter.
Les exemples positifs montrant comment Claude peut communiquer avec le niveau de concision approprié ont tendance à être plus efficaces que les exemples négatifs ou les instructions qui indiquent au modèle ce qu'il ne doit pas faire. Sur Claude Opus 5, les réponses visibles par défaut et les livrables écrits sont plus longs que sur les modèles Opus antérieurs, et abaisser l'effort réduit le volume de réflexion sans raccourcir de manière fiable la réponse visible ; demandez explicitement de la concision ou une longueur cible dans le prompt. Consultez Longueur des réponses et verbosité.
Suivi des instructions plus littéral : Claude Opus 4.7 interprète les prompts de manière plus littérale et explicite que Claude Opus 4.6, en particulier aux niveaux d'effort inférieurs. Il ne généralise pas silencieusement une instruction d'un élément à un autre, et il n'infère pas des demandes que vous n'avez pas formulées. L'avantage de ce littéralisme est la précision et moins de tâtonnements. Il fonctionne généralement mieux pour les cas d'usage API avec des prompts soigneusement ajustés, l'extraction structurée et les pipelines où vous souhaitez un comportement prévisible. Une revue des prompts et du harnais peut être particulièrement utile pour la migration vers Claude Opus 5.
Ton plus direct : Comme avec tout nouveau modèle, le style de prose sur les écrits longs peut évoluer. Claude Opus 4.7 est plus direct et affirmé, avec moins de formulations de validation et moins d'emoji que le style plus chaleureux de Claude Opus 4.6. Si votre produit repose sur une voix spécifique, réévaluez les prompts de style par rapport à la nouvelle base de référence.
Mises à jour de progression intégrées dans les traces agentiques : Claude Opus 4.7 fournit des mises à jour plus régulières et de meilleure qualité à l'utilisateur tout au long des longues traces agentiques. Si vous avez ajouté un échafaudage pour forcer des messages d'état intermédiaires (« Après chaque 3 appels d'outils, résumez la progression »), essayez de le supprimer. Si vous constatez que la longueur ou le contenu des mises à jour destinées à l'utilisateur de Claude Opus 4.7 ne sont pas bien calibrés pour votre cas d'usage, décrivez explicitement à quoi ces mises à jour doivent ressembler dans le prompt et fournissez des exemples.
Création de sous-agents modifiée : Claude Opus 4.7 a tendance à créer moins de sous-agents par défaut que Claude Opus 4.6, tandis que Claude Opus 5 délègue aux sous-agents plus volontiers que les modèles antérieurs. Le comportement est orientable via le prompting dans les deux directions ; donnez des indications explicites sur les situations où les sous-agents sont souhaitables, ou plafonnez le nombre de sous-agents. Consultez Contrôler la création de sous-agents.
Calibration de l'effort plus stricte : Changement significatif par rapport à Claude Opus 4.6, Claude Opus 4.7 respecte strictement les niveaux d'effort, en particulier dans le bas de l'échelle. À low et medium, le modèle limite son travail à ce qui a été demandé plutôt que d'en faire plus que nécessaire.
C'est bénéfique pour la latence et les coûts, mais sur des tâches modérément complexes exécutées à l'effort low, il existe un certain risque de sous-réflexion. Si vous observez un raisonnement superficiel sur des problèmes complexes, augmentez l'effort à high ou xhigh plutôt que de contourner le problème par le prompting.
Si vous devez maintenir l'effort à low pour la latence, ajoutez des indications ciblées : « Cette tâche implique un raisonnement en plusieurs étapes. Réfléchissez soigneusement au problème avant de répondre. » Consultez Niveaux d'effort recommandés pour Claude Opus 4.7.
Moins d'appels d'outils par défaut : Claude Opus 4.7 a tendance à utiliser les outils moins souvent que Claude Opus 4.6 et à utiliser davantage le raisonnement. Cela produit de meilleurs résultats dans la plupart des cas.
Pour augmenter l'utilisation d'outils, augmentez le réglage d'effort. Les réglages d'effort high ou xhigh montrent une utilisation d'outils nettement plus importante dans la recherche agentique et le codage. Vous pouvez également ajuster votre prompt pour indiquer explicitement au modèle quand et comment utiliser correctement ses outils.
Protections de cybersécurité en temps réel : Nouvellement ajoutées dans Claude Opus 4.7, les requêtes impliquant des sujets interdits ou à haut risque peuvent entraîner des refus. Pour les travaux de sécurité légitimes tels que les tests d'intrusion, la recherche de vulnérabilités ou le red-teaming, postulez au Cyber Verification Program pour demander des restrictions réduites. Consultez Safeguards, warnings, and appeals pour le contexte.
Prise en charge des images haute résolution : Claude Opus 4.7 est le premier modèle Claude avec prise en charge des images haute résolution. La résolution d'image maximale est de 2 576 pixels sur le côté le plus long, contre 1 568 pixels sur les modèles précédents. Cela débloque des gains sur les charges de travail à forte composante visuelle et est particulièrement précieux pour l'utilisation de l'ordinateur, la compréhension de captures d'écran et l'analyse de documents.
La prise en charge de la haute résolution est automatique et ne nécessite aucun en-tête bêta ni activation côté client. Deux points à anticiper :
max_tokens et les attentes de coûts pour les charges de travail riches en images, ou sous-échantillonnez avant l'envoi si vous n'avez pas besoin de la fidélité supplémentaire.Consultez Prise en charge des images haute résolution sur Claude Opus 4.7 pour plus de détails.
Ceux-ci ne sont pas obligatoires mais amélioreront votre expérience :
Réévaluez max_tokens : Étant donné que le même texte produit un nombre de tokens plus élevé sur Claude Opus 4.7 et les modèles ultérieurs, mettez à jour vos paramètres max_tokens pour offrir une marge supplémentaire, y compris les déclencheurs de compactage. Les interventions de prompting, task_budget et effort peuvent aider à contrôler les coûts et à garantir une utilisation appropriée des tokens.
Auditez les attentes de comptage de tokens : Tout chemin de code qui estime les tokens côté client ou suppose un ratio tokens/caractères fixe doit être retesté avec Claude Opus 5. Utilisez le point de terminaison de comptage de tokens pour vérifier.
Adoptez les budgets de tâche (bêta) : Claude Opus 4.7 introduit les budgets de tâche. Ces budgets vous permettent d'informer Claude du nombre de tokens dont il dispose pour une boucle agentique complète, y compris la réflexion, les appels d'outils, les résultats d'outils et la sortie finale. Le modèle voit un compte à rebours en cours et l'utilise pour prioriser le travail et terminer la tâche proprement à mesure que le budget est consommé. Pour l'utiliser, définissez l'en-tête bêta task-budgets-2026-03-13 et ajoutez ce qui suit à votre configuration de sortie :
output_config = {
"effort": "high",
"task_budget": {"type": "tokens", "total": 128000},
}Vous devrez peut-être expérimenter différents budgets de tâche pour votre cas d'usage. Si le modèle reçoit un budget de tâche trop restrictif, il peut accomplir la tâche de manière moins approfondie, en mentionnant son budget comme contrainte.
Pour les tâches agentiques ouvertes où la qualité compte plus que la vitesse, ne définissez pas de budget de tâche. Réservez les budgets de tâche aux charges de travail où vous avez besoin que le modèle limite son travail à une allocation de tokens. La valeur minimale pour un budget de tâche est de 20k tokens.
Un budget de tâche n'est pas un plafond strict ; c'est une suggestion dont le modèle a connaissance. Il diffère de max_tokens :
task_budget : un plafond indicatif sur l'ensemble de la boucle agentique. Le modèle le voit et l'utilise pour se réguler.max_tokens : un plafond strict par requête sur les tokens générés. Il n'est pas transmis au modèle, donc le modèle n'en a pas connaissance.Utilisez task_budget lorsque vous voulez que le modèle s'autorégule, et max_tokens comme plafond strict pour limiter l'utilisation.
Définissez un max_tokens élevé à l'effort max ou xhigh : Si vous exécutez Claude Opus 4.7 ou un modèle ultérieur à l'effort max ou xhigh, définissez un budget de tokens de sortie maximum élevé pour que le modèle ait de la place pour réfléchir et agir à travers ses sous-agents et appels d'outils. Commencez à 64k tokens et ajustez à partir de là.
Sous-échantillonnez les images si la haute résolution n'est pas nécessaire : Claude Opus 4.7 et les modèles ultérieurs prennent en charge les images jusqu'à 2576px / 3,75MP. Les images haute résolution utilisent plus de tokens. Si la fidélité d'image supplémentaire n'est pas nécessaire, sous-échantillonnez les images avant de les envoyer à Claude pour éviter les augmentations d'utilisation de tokens. Consultez Images et vision.
Envisagez les replis automatiques : Claude Opus 5 est livré avec des classificateurs de sécurité en cybersécurité dont les refus de catégorie cyber peuvent se replier sur Claude Opus 4.8. Pour réexécuter automatiquement les requêtes refusées sur un autre modèle, envisagez le paramètre fallbacks avec le mode "default" (fallbacks: "default"), qui sélectionne un modèle de repli recommandé en fonction de la catégorie de refus au lieu d'une liste de modèles maintenue manuellement. Le repli côté serveur est en bêta ; le mode "default" nécessite l'en-tête bêta server-side-fallback-2026-07-01. Consultez Refus et repli.
Mettez en cache des prompts plus courts : La longueur minimale de prompt pouvant être mise en cache sur Claude Opus 5 est de 512 tokens, inférieure à celle des modèles Opus antérieurs. Les prompts qui étaient trop courts pour être mis en cache peuvent désormais créer des entrées de cache, sans aucune modification de code requise. Consultez Mise en cache des prompts pour les minimums par modèle.
Modifiez les outils en cours de conversation (bêta) : Vous pouvez ajouter ou supprimer des outils entre les tours d'une conversation sans invalider les correspondances du cache de prompts sur les tours précédents. Envoyez l'en-tête bêta mid-conversation-tool-changes-2026-07-01. C'est utile pour les charges de travail agentiques qui exposent les outils progressivement ou les retirent à mesure qu'une tâche avance ; sans cela, une liste d'outils modifiée invalide le préfixe mis en cache.
Supprimez les instructions de vérification héritées et limitez la portée : Claude Opus 5 vérifie son propre travail sans qu'on le lui demande, donc supprimez les instructions explicites de vérification ou d'auto-contrôle héritées de prompts ajustés pour des modèles antérieurs ; les conserver provoque une sur-vérification. Pour les tâches restreintes, limitez explicitement la portée de la tâche. Consultez Portée de la tâche et sur-vérification.
claude-opus-4-6 vers claude-opus-5 (ou mettez à jour les alias).temperature, top_p et top_k des charges utiles de requête.thinking: {type: "enabled", budget_tokens: N} par thinking: {type: "adaptive"} plus le paramètre effort, ou supprimez entièrement le champ thinking ; la réflexion adaptative est activée par défaut sur Claude Opus 5.thinking : elles s'exécutent avec la réflexion sur Claude Opus 5. Réexaminez max_tokens, qui reste une limite stricte sur la sortie totale (réflexion plus texte de réponse), ou passez thinking: {type: "disabled"} à l'effort high ou inférieur pour préserver l'ancien comportement.thinking: {type: "disabled"} avec un effort xhigh ou max renvoie une erreur 400, appliquée à chaque requête. Réactivez la réflexion ou abaissez l'effort à high ou en dessous.max_tokens pour tenir compte de la tokenisation mise à jour.xhigh ou max, augmentez max_tokens à au moins 64k comme point de départ.stop_reason: "refusal", et envisagez fallbacks: "default" (bêta) pour réexécuter automatiquement les requêtes refusées sur un modèle de repli recommandé.Si vous migrez depuis Claude Opus 4.5, Opus 4.1 (obsolète) ou un modèle antérieur directement vers Claude Opus 5, appliquez tous les changements décrits plus haut dans cette section plus les changements cumulatifs ci-dessous, qui ont pris effet entre Opus 4.5 et Opus 4.7. Si vous migrez depuis Opus 4.6, les changements décrits plus haut dans cette section sont tout ce dont vous avez besoin.
# Migration vers Opus
model = "claude-opus-4-5" # Before
model = "claude-opus-5" # AfterLa suppression du prefill est couverte dans les changements incompatibles pour la migration depuis Claude Opus 4.6.
Échappement des paramètres d'outils : Claude Opus 4.6 et les modèles ultérieurs peuvent produire un échappement de chaînes JSON légèrement différent dans les arguments d'appels d'outils (par exemple, une gestion différente des échappements Unicode ou de l'échappement des barres obliques). Si vous analysez l'input d'un appel d'outil comme une chaîne brute plutôt qu'en utilisant un analyseur JSON, vérifiez votre logique d'analyse. Les analyseurs JSON standard (tels que json.loads() ou JSON.parse()) gèrent ces différences automatiquement.
Ces changements améliorent votre expérience sur Claude Opus 4.7 et les modèles ultérieurs. Les éléments marqués (obligatoire sur Opus 4.7) étaient des recommandations facultatives au lancement d'Opus 4.6 mais sont désormais obligatoires ; les autres restent recommandés.
Migrez vers la réflexion adaptative (obligatoire sur Opus 4.7) : thinking: {type: "enabled", budget_tokens: N} renvoie une erreur 400 sur Claude Opus 4.7 et les modèles ultérieurs. Passez à thinking: {type: "adaptive"} et utilisez le paramètre effort pour contrôler la profondeur de réflexion ; sur Claude Opus 5, thinking: {type: "adaptive"} est équivalent à l'omission du champ thinking, qui s'exécute avec la réflexion adaptative par défaut. Consultez Réflexion.
response = client.beta.messages.create(
model="claude-opus-4-5",
max_tokens=16000,
thinking={"type": "enabled", "budget_tokens": 32000},
betas=["interleaved-thinking-2025-05-14"],
messages=[{"role": "user", "content": "Your prompt here"}],
)Notez que la migration passe également de client.beta.messages.create à client.messages.create. La réflexion adaptative et l'effort sont des fonctionnalités en disponibilité générale et ne nécessitent pas l'espace de noms SDK bêta ni aucun en-tête bêta.
Supprimez l'en-tête bêta effort : Le paramètre effort est désormais en disponibilité générale. Supprimez betas=["effort-2025-11-24"] de vos requêtes.
Supprimez l'en-tête bêta de streaming d'outils à granularité fine : Le streaming d'outils à granularité fine est désormais en disponibilité générale. Supprimez betas=["fine-grained-tool-streaming-2025-05-14"] de vos requêtes.
Supprimez l'en-tête bêta de réflexion entrelacée : La réflexion adaptative active automatiquement la réflexion entrelacée sur Claude Opus 4.7, Opus 4.6 et Sonnet 4.6. Supprimez betas=["interleaved-thinking-2025-05-14"] de vos requêtes. L'en-tête est toujours fonctionnel sur Sonnet 4.6 avec la réflexion étendue manuelle, mais le mode manuel est obsolète.
Migrez vers output_config.format : Si vous utilisez les sorties structurées, mettez à jour output_format={...} vers output_config={"format": {...}}. L'ancien paramètre reste fonctionnel mais est obsolète et sera supprimé dans une future version de modèle.
Si vous migrez depuis Opus 4.1 (obsolète) ou des modèles antérieurs directement vers Claude Opus 5, appliquez tous les changements décrits plus haut dans cette section, plus les changements supplémentaires de cette sous-section.
# Depuis Opus 4.1
model = "claude-opus-4-1-20250805" # Before
model = "claude-opus-5" # After
# Depuis Sonnet 3.7
model = "claude-3-7-sonnet-20250219" # Before
model = "claude-opus-5" # AfterSupprimez les paramètres d'échantillonnage
À partir de Claude Opus 4.7, définir temperature, top_p ou top_k à une valeur non par défaut renvoie une erreur 400. Le chemin de migration le plus sûr consiste à omettre entièrement ces paramètres des requêtes et à utiliser le prompting pour guider le comportement du modèle. Si vous utilisiez temperature = 0 pour le déterminisme, notez que cela n'a jamais garanti des sorties identiques.
# Avant - Ceci provoquera une erreur dans les modèles Claude 4+
response = client.messages.create(
model="claude-3-7-sonnet-20250219",
temperature=0.7,
top_p=0.9, # Non-default sampling params return 400 on Opus 4.7
# ...
)
# Après
response = client.messages.create(
model="claude-opus-5",
# ...
)Mettez à jour les versions des outils
Mettez à jour vers les dernières versions des outils. Supprimez tout code utilisant la commande undo_edit.
# Avant
tools = [{"type": "text_editor_20250124", "name": "str_replace_editor"}]
# Après
tools = [{"type": "text_editor_20250728", "name": "str_replace_based_edit_tool"}]text_editor_20250728 et str_replace_based_edit_tool. Consultez la documentation de l'outil d'édition de texte pour plus de détails.code_execution_20260521. Consultez la documentation de l'outil d'exécution de code pour les instructions de migration.Gérez la raison d'arrêt refusal
Mettez à jour votre application pour gérer les raisons d'arrêt refusal :
response = client.messages.create(...)
if response.stop_reason == "refusal":
# Gérer le refus de manière appropriée
passGérez la raison d'arrêt model_context_window_exceeded
Les modèles Claude 4.5+ renvoient une raison d'arrêt model_context_window_exceeded lorsque la génération s'arrête parce que la limite de la fenêtre de contexte est atteinte, plutôt que la limite max_tokens demandée. Mettez à jour votre application pour gérer cette nouvelle raison d'arrêt :
response = client.messages.create(...)
if response.stop_reason == "model_context_window_exceeded":
# Gérer la limite de la fenêtre de contexte de manière appropriée
passVérifiez la gestion des paramètres d'outils (sauts de ligne finaux)
Les modèles Claude 4.5+ préservent les sauts de ligne finaux dans les paramètres de chaîne des appels d'outils qui étaient auparavant supprimés. Si vos outils reposent sur une correspondance exacte de chaînes avec les paramètres d'appels d'outils, vérifiez que votre logique gère correctement les sauts de ligne finaux.
Mettez à jour vos prompts pour les changements comportementaux
Les modèles Claude 4+ ont un style de communication plus concis et direct et nécessitent des directives explicites. Consultez les bonnes pratiques de prompting pour des conseils d'optimisation.
token-efficient-tools-2025-02-19 et output-128k-2025-02-19. Tous les modèles Claude 4+ ont une utilisation d'outils économe en tokens intégrée et ces en-têtes n'ont aucun effet.claude-opus-5output_config.formatthinking: {type: "enabled", budget_tokens: N} par thinking: {type: "adaptive"} plus le paramètre effort (renvoie une erreur 400 sur Opus 4.7)effort-2025-11-24 (effort est désormais en disponibilité générale)fine-grained-tool-streaming-2025-05-14interleaved-thinking-2025-05-14 (la réflexion adaptative active automatiquement la réflexion entrelacée)output_format vers output_config.format (le cas échéant)temperature, top_p et top_k (les valeurs non par défaut renvoient une erreur 400 sur Opus 4.7)text_editor_20250728, code_execution_20260521)refusalmodel_context_window_exceededtoken-efficient-tools-2025-02-19, output-128k-2025-02-19)Claude Opus 5 et Claude Sonnet 5 partagent la même surface d'API : les deux fonctionnent avec la réflexion adaptative activée par défaut, les deux ont le paramètre effort défini par défaut sur high sur l'API Claude et Claude Code, les deux offrent par défaut une fenêtre de contexte de 1M de tokens avec 128k tokens de sortie maximum, et aucun des deux ne prend en charge le Priority Tier. La réflexion étendue manuelle et les paramètres d'échantillonnage non par défaut renvoient une erreur 400 sur les deux modèles, tout comme le préremplissage de l'assistant.
model = "claude-sonnet-5" # Before
model = "claude-opus-5" # AfterTarification : Claude Opus 5 est tarifé à 5 $ par million de tokens d'entrée et 25 $ par million de tokens de sortie. Pour Claude Sonnet 5, une tarification de lancement de 2 $/10 $ par million de tokens d'entrée/sortie est en vigueur jusqu'au 31 août 2026, après quoi la tarification standard de 3 $/15 $ prend effet. Consultez la tarification de Claude pour la tarification complète.
La désactivation de la réflexion est plafonnée à l'effort high : Sur Claude Sonnet 5, thinking: {type: "disabled"} est accepté à n'importe quel niveau d'effort. Sur Claude Opus 5, il n'est accepté qu'à un niveau d'effort de high ou inférieur ; une requête qui combine thinking: {type: "disabled"} avec un effort xhigh ou max renvoie une erreur 400, appliquée à chaque requête. Auditez les requêtes qui désactivent la réflexion avant de migrer.
Messages système en milieu de conversation : Claude Opus 5 accepte les messages role: "system" immédiatement après un tour utilisateur dans le tableau messages (sous réserve des règles de placement) ; Claude Sonnet 5 ne les accepte pas. Si vous maintenez des chemins de code qui reconstruisent l'historique complet des messages pour mettre à jour les instructions, vous pouvez les simplifier et préserver les correspondances du cache de prompts sur les tours précédents.
Web fetch n'est pas disponible : L'outil web fetch est disponible sur Claude Sonnet 5 mais pas sur Claude Opus 5.
claude-sonnet-5 vers claude-opus-5.thinking: {type: "disabled"} avec un effort xhigh ou max renvoie une erreur 400 sur Claude Opus 5. Réactivez la réflexion ou abaissez l'effort à high ou inférieur.Claude Sonnet 5 offre la meilleure combinaison de vitesse et d'intelligence de la famille de modèles Claude. Il s'appuie sur Claude Sonnet 4.6.
Claude Sonnet 5 est une mise à niveau directe de Claude Sonnet 4.6. Une tarification de lancement de 2 $/10 $ USD par million de tokens d'entrée/sortie est en vigueur jusqu'au 31 août 2026, après quoi la tarification standard de 3 $/15 $ USD par million de tokens d'entrée/sortie prendra effet ; consultez la Tarification pour plus de détails. Il y a deux changements d'API avec rupture de compatibilité pour le code fonctionnant déjà sur Claude Sonnet 4.6 : la réflexion étendue manuelle (thinking: {type: "enabled", budget_tokens: N}) et les paramètres d'échantillonnage (temperature, top_p, top_k) définis sur des valeurs non par défaut ne sont plus acceptés et renvoient une erreur 400. Utilisez plutôt la réflexion adaptative avec le paramètre effort. Claude Sonnet 5 prend en charge le même ensemble de fonctionnalités que Claude Sonnet 4.6, y compris la fenêtre de contexte de 1M de tokens, la réflexion adaptative, la mise en cache des prompts, le traitement par lots, l'API Files, la prise en charge des PDF, la vision, et l'ensemble complet des outils côté serveur et côté client. Le Priority Tier n'est pas disponible sur Claude Sonnet 5. Claude Sonnet 5 utilise également un nouveau tokenizer.
# Migration vers Sonnet
model = "claude-sonnet-4-6" # Before
model = "claude-sonnet-5" # AfterLes éléments 4 et 5 de la liste suivante sont des changements avec rupture de compatibilité. max_tokens reste une limite stricte sur la sortie totale (réflexion plus texte de réponse), donc réexaminez-le pour les charges de travail qui fonctionnaient sans réflexion sur Claude Sonnet 4.6.
Nouveau tokenizer : Claude Sonnet 5 utilise un nouveau tokenizer. Le même texte d'entrée produit environ 30 % de tokens de plus que sur Claude Sonnet 4.6. L'augmentation exacte dépend du contenu. Les requêtes, les réponses et les événements de streaming conservent la même forme, et aucune modification de code n'est requise, mais tout ce que vous mesurez ou budgétisez en tokens change : les champs usage et les résultats du comptage de tokens pour le même texte sont plus élevés, la fenêtre de contexte de 1M de tokens contient moins de texte, et une limite max_tokens ajustée pour Claude Sonnet 4.6 peut tronquer une sortie équivalente. La tarification par token est inchangée, donc le coût d'une requête équivalente peut différer. Réexécutez le comptage de tokens sur Claude Sonnet 5 plutôt que de réutiliser les comptages mesurés sur des modèles antérieurs.
128k tokens de sortie maximum (inchangé) : Claude Sonnet 5 prend en charge jusqu'à 128k tokens de sortie, comme Claude Sonnet 4.6. Les valeurs max_tokens existantes restent valides. Tenez compte du nouveau tokenizer lors de leur dimensionnement.
Préremplissage des messages de l'assistant (inchangé) : Le préremplissage du message de l'assistant renvoie une erreur 400 sur Claude Sonnet 5, comme sur Claude Sonnet 4.6. Si vous avez supprimé le préremplissage lors de la migration vers Claude Sonnet 4.6, aucune autre modification n'est nécessaire. Utilisez plutôt les sorties structurées, les instructions de l'invite système, ou output_config.format.
Réflexion adaptative activée par défaut : Sur Claude Sonnet 4.6, les requêtes sans champ thinking s'exécutent sans réflexion ; sur Claude Sonnet 5, les mêmes requêtes s'exécutent avec la réflexion adaptative. Pour désactiver la réflexion, passez thinking: {type: "disabled"}. La réflexion étendue manuelle (thinking: {type: "enabled", budget_tokens: N}) n'est pas prise en charge et renvoie une erreur 400. Utilisez le paramètre effort (par défaut high) pour contrôler la profondeur de réflexion.
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=16000,
thinking={"type": "adaptive", "display": "summarized"},
output_config={"effort": "high"},
messages=[
{
"role": "user",
"content": "Are there an infinite number of prime numbers such that n mod 4 == 3?",
}
],
)
# La réponse contient des blocs de réflexion résumés et des blocs de texte
for block in response.content:
match block.type:
case "thinking":
print(f"\nThinking summary: {block.thinking}")
case "text":
print(f"\nResponse: {block.text}")Paramètres d'échantillonnage supprimés : Les paramètres d'échantillonnage (temperature, top_p, top_k) définis sur une valeur non par défaut ne sont pas acceptés et renvoient une erreur 400.
Protections en cybersécurité : Claude Sonnet 5 est le premier modèle de niveau Sonnet doté de protections en cybersécurité en temps réel. Les requêtes impliquant des sujets de cybersécurité interdits ou à haut risque peuvent être refusées. Les refus sont renvoyés sous forme de réponse HTTP 200 réussie avec stop_reason: "refusal", et non comme une erreur. Consultez Protections, avertissements et recours pour le contexte.
claude-sonnet-4-6 vers claude-sonnet-5.max_tokens dimensionnées au plus près de votre longueur de sortie attendue, et augmentez-les jusqu'au maximum de 128k (inchangé par rapport à Claude Sonnet 4.6) lorsque cela est utile.thinking: {type: "enabled", budget_tokens: N} (renvoie une erreur 400). La réflexion adaptative est activée par défaut ; passez {type: "disabled"} pour la désactiver, ou utilisez le paramètre effort pour contrôler la profondeur.temperature, top_p et top_k définis sur des valeurs non par défaut (ils renvoient une erreur 400 sur Claude Sonnet 5).stop_reason: "refusal" si votre charge de travail peut toucher à des sujets de cybersécurité.max_tokens pour les charges de travail qui fonctionnaient auparavant sans réflexion.Si vous migrez de Claude Sonnet 4.5 ou d'un modèle Sonnet antérieur directement vers Claude Sonnet 5, appliquez les changements de Migration vers Claude Sonnet 5 depuis Claude Sonnet 4.6 plus les changements de cette section.
Le préremplissage des messages de l'assistant n'est plus pris en charge
Le préremplissage des messages de l'assistant renvoie une erreur 400 sur Claude Sonnet 4.6 et les modèles ultérieurs, y compris Claude Sonnet 5. Utilisez plutôt les sorties structurées, les instructions de l'invite système, ou output_config.format.
Cas d'utilisation courants du préremplissage et migrations :
Contrôle du formatage de sortie (forcer une sortie JSON/YAML) : Utilisez les sorties structurées ou des outils avec des champs enum pour les tâches de classification.
Élimination des préambules (suppression des formules « Voici... ») : Ajoutez des instructions directes dans l'invite système : « Répondez directement sans préambule. Ne commencez pas par des formules comme "Voici...", "Sur la base de...", etc. »
Éviter les refus injustifiés : Claude est désormais bien meilleur pour les refus appropriés. Un prompt clair dans le message utilisateur sans préremplissage devrait suffire.
Continuations (reprise de réponses interrompues) : Déplacez la continuation dans le message utilisateur : « Votre réponse précédente a été interrompue et s'est terminée par [previous_response]. Continuez là où vous vous êtes arrêté. »
Hydratation du contexte / cohérence du rôle (rafraîchissement du contexte dans les longues conversations) : Injectez plutôt dans le tour utilisateur ce qui était auparavant des rappels préremplis dans le message de l'assistant.
L'échappement JSON des paramètres d'outils peut différer
L'échappement des chaînes JSON dans les paramètres d'outils peut différer des modèles précédents. Les analyseurs JSON standard gèrent cela automatiquement, mais une analyse personnalisée basée sur des chaînes peut nécessiter des mises à jour.
Changements de la réflexion étendue : Les configurations budget_tokens de Claude Sonnet 4.5 (thinking: {type: "enabled", budget_tokens: N}) ne sont pas prises en charge sur Claude Sonnet 5 et renvoient une erreur 400. La réflexion adaptative est activée par défaut, donc la plupart des charges de travail n'ont besoin d'aucune configuration thinking ; utilisez le paramètre effort pour contrôler la profondeur de réflexion. Si vous exécutiez Claude Sonnet 4.5 sans réflexion étendue, passez thinking: {type: "disabled"} pour préserver ce comportement.
Supprimez les paramètres d'échantillonnage
Les paramètres d'échantillonnage (temperature, top_p, top_k) définis sur une valeur non par défaut renvoient une erreur 400 sur Claude Sonnet 5. Supprimez-les des requêtes et utilisez plutôt le prompting pour guider le comportement du modèle.
Mettez à jour les versions des outils
Mettez à jour vers les dernières versions des outils (text_editor_20250728, code_execution_20260521). Supprimez tout code utilisant la commande undo_edit.
Gérez la raison d'arrêt refusal
Mettez à jour votre application pour gérer les raisons d'arrêt refusal.
Mettez à jour vos prompts pour les changements de comportement
Les modèles Claude 4 ont un style de communication plus concis et direct. Consultez les bonnes pratiques de prompting pour des conseils d'optimisation.
Claude Haiku 4.5 et Claude Sonnet 5 diffèrent davantage au niveau de l'API que des modèles adjacents au sein d'une même classe : Claude Haiku 4.5 utilise la réflexion étendue manuelle (désactivée par défaut), une fenêtre de contexte de 200k tokens, et jusqu'à 64k tokens de sortie, tandis que Claude Sonnet 5 fonctionne avec la réflexion adaptative activée par défaut, offre par défaut une fenêtre de contexte de 1M de tokens, et prend en charge jusqu'à 128k tokens de sortie.
model = "claude-haiku-4-5-20251001" # Before
model = "claude-sonnet-5" # AfterConfiguration de la réflexion : Claude Haiku 4.5 prend en charge la réflexion étendue manuelle (thinking: {type: "enabled", budget_tokens: N}) et rejette thinking: {type: "adaptive"}. Sur Claude Sonnet 5, la prise en charge est inversée : la réflexion adaptative est activée par défaut, et la réflexion étendue manuelle renvoie une erreur 400. Supprimez les configurations thinking: {type: "enabled", budget_tokens: N} et fiez-vous à la valeur par défaut, ou passez thinking: {type: "disabled"} pour désactiver la réflexion. budget_tokens n'a pas de remplacement direct ; utilisez le paramètre effort pour contrôler la profondeur de réflexion. Effort n'est pas disponible sur Claude Haiku 4.5 et vaut par défaut high sur Claude Sonnet 5.
Paramètres d'échantillonnage supprimés : temperature et top_p fonctionnent sur Claude Haiku 4.5 (un à la fois, pas les deux). Sur Claude Sonnet 5, définir temperature, top_p ou top_k sur une valeur non par défaut renvoie une erreur 400. Supprimez ces paramètres et utilisez le prompting pour guider le comportement du modèle.
Préremplissage de l'assistant supprimé : Le préremplissage du message de l'assistant fonctionne sur Claude Haiku 4.5 mais renvoie une erreur 400 sur Claude Sonnet 5. Utilisez plutôt les sorties structurées, les instructions de l'invite système, ou output_config.format.
Fenêtre de contexte et sortie plus grandes : Claude Sonnet 5 offre par défaut une fenêtre de contexte de 1M de tokens, contre 200k tokens sur Claude Haiku 4.5, et prend en charge jusqu'à 128k tokens de sortie, contre 64k. Claude Sonnet 5 utilise également un tokenizer différent, donc réexécutez le comptage de tokens plutôt que de réutiliser les comptages mesurés sur Claude Haiku 4.5.
Tarification : Claude Haiku 4.5 est tarifé à 1 $/5 $ par million de tokens d'entrée/sortie. Pour Claude Sonnet 5, une tarification de lancement de 2 $/10 $ par million de tokens d'entrée/sortie est en vigueur jusqu'au 31 août 2026, après quoi la tarification standard de 3 $/15 $ prend effet. Consultez la tarification de Claude.
Protections en cybersécurité : Claude Sonnet 5 dispose de protections en cybersécurité en temps réel. Les requêtes impliquant des sujets de cybersécurité interdits ou à haut risque peuvent être refusées, renvoyées sous forme de réponse HTTP 200 réussie avec stop_reason: "refusal". Consultez Protections, avertissements et recours pour le contexte.
claude-haiku-4-5-20251001 (ou l'alias claude-haiku-4-5) vers claude-sonnet-5.thinking: {type: "enabled", budget_tokens: N} (renvoie une erreur 400). La réflexion adaptative est activée par défaut ; passez thinking: {type: "disabled"} pour préserver le comportement sans réflexion, et réexaminez max_tokens pour les charges de travail qui fonctionnaient sans réflexion.high) pour contrôler la profondeur de réflexion et la consommation de tokens ; il n'est pas disponible sur Claude Haiku 4.5, donc aucun réglage existant n'est reporté.temperature et top_p (les valeurs non par défaut renvoient une erreur 400 sur Claude Sonnet 5).max_tokens, que vous pouvez augmenter jusqu'au maximum de 128k.stop_reason: "refusal" si votre charge de travail peut toucher à des sujets de cybersécurité.Claude Haiku 4.5 est le modèle Haiku le plus rapide et le plus intelligent avec des performances proches de la frontière, offrant une qualité de modèle premium pour les applications interactives et le traitement à haut volume.
Pour un aperçu complet des capacités, consultez l'aperçu des modèles.
Mettez à jour le nom de votre modèle :
# Depuis Haiku 3.5
model = "claude-3-5-haiku-20241022" # Before
model = "claude-haiku-4-5-20251001" # AfterExaminez les nouvelles limites de débit : Haiku 4.5 a des limites de débit distinctes de celles de Haiku 3.5. Consultez la documentation sur les limites de débit pour plus de détails.
Explorez les nouvelles capacités : Consultez l'aperçu des modèles pour plus de détails sur la conscience du contexte, la capacité de sortie accrue (64k tokens), l'intelligence supérieure et la vitesse améliorée.
Ces changements avec rupture de compatibilité s'appliquent lors de la migration depuis les modèles Haiku Claude 3.x.
Mettez à jour les paramètres d'échantillonnage
Utilisez uniquement temperature OU top_p, pas les deux. Définir les deux renvoie une erreur 400 sur Claude Haiku 4.5.
Mettez à jour les versions des outils
Mettez à jour vers les dernières versions des outils (text_editor_20250728, code_execution_20250825). Supprimez tout code utilisant la commande undo_edit.
Gérez la raison d'arrêt refusal
Mettez à jour votre application pour gérer les raisons d'arrêt refusal.
Mettez à jour vos prompts pour les changements de comportement
Les modèles Claude 4 ont un style de communication plus concis et direct. Consultez les bonnes pratiques de prompting pour des conseils d'optimisation.
claude-haiku-4-5-20251001text_editor_20250728, code_execution_20250825) ; les versions héritées ne sont pas prises en chargeundo_edit (le cas échéant)temperature OU top_p, pas les deux (définir les deux renvoie une erreur 400)refusal dans votre applicationWas this page helpful?