Claude Opus 4.8 est conçu pour le codage agentique complexe et le travail en entreprise. Il s'appuie sur Claude Opus 4.7. Cette page résume toutes les nouveautés au lancement, y compris le « fast mode » (mode rapide, aperçu de recherche sur l'API Claude) et une longueur minimale de prompt pouvant être mis en cache abaissée à 1 024 tokens.
| Modèle | ID de modèle API | Description |
|---|---|---|
| Claude Opus 4.8 | claude-opus-4-8 | Pour le codage agentique complexe et le travail en entreprise |
Claude Opus 4.8 prend en charge la fenêtre de contexte de 1M de tokens par défaut sur l'API Claude, Amazon Bedrock, Google Cloud et Microsoft Foundry, 128k tokens de sortie maximum, la réflexion adaptative, ainsi que le même ensemble d'outils et de fonctionnalités de plateforme que Claude Opus 4.7.
Pour la tarification complète et les spécifications, consultez la vue d'ensemble des modèles.
Claude Opus 4.8 accepte les messages role: "system" immédiatement après un tour utilisateur dans le tableau messages (sous réserve des règles de placement). Cela vous permet d'ajouter des instructions mises à jour plus tard dans une conversation de longue durée sans répéter l'invite système complète. Mettre à jour les instructions de cette manière préserve les correspondances de cache de prompt sur les tours précédents et réduit le coût d'entrée sur les boucles agentiques. Aucun en-tête bêta n'est requis. Consultez Messages système en milieu de conversation pour les détails d'utilisation.
L'objet stop_details sur les réponses de refus (disponible depuis Claude Opus 4.7) est désormais documenté publiquement. Lorsque Claude refuse de compléter une requête, cet objet décrit la catégorie de refus, en plus de la raison d'arrêt refusal existante. Votre application peut l'utiliser pour distinguer différentes classes de requêtes refusées et orienter l'utilisateur vers la bonne étape suivante. Aucun en-tête bêta n'est requis. Consultez Refus et solution de repli pour la liste des catégories et Raisons d'arrêt et solution de repli pour des conseils de gestion.
La valeur par défaut du paramètre effort sur Claude Opus 4.8 est high sur toutes les surfaces, y compris l'API Claude et Claude Code. Si vous définissez explicitement l'effort aujourd'hui, votre réglage reste inchangé. Consultez Effort pour des conseils par niveau.
Le mode rapide est désormais disponible pour Claude Opus 4.8 en tant qu'aperçu de recherche sur l'API Claude. Définissez speed: "fast" avec l'en-tête bêta fast-mode-2026-02-01 pour obtenir jusqu'à 2,5 fois plus de tokens de sortie par seconde à partir du même modèle, à un tarif premium. Consultez Mode rapide pour l'accès, les modèles pris en charge et la tarification.
La longueur minimale de prompt pouvant être mis en cache sur Claude Opus 4.8 est de 1 024 tokens, contre 2 048 tokens sur Claude Opus 4.7. Les prompts qui étaient trop courts pour être mis en cache sur Claude Opus 4.7 peuvent désormais créer des entrées de cache sans modification de code. Consultez Mise en cache des prompts pour les minimums par modèle.
Ces contraintes sont inchangées par rapport à Claude Opus 4.7, donc le code qui fonctionne déjà sur Claude Opus 4.7 ne nécessite aucune modification. Elles s'appliquent uniquement à l'API Messages. Les Claude Managed Agents ne sont pas affectés.
Définir temperature, top_p ou top_k à une valeur autre que celle par défaut renvoie une erreur 400 sur Claude Opus 4.8, comme sur Claude Opus 4.7. Omettez ces paramètres et utilisez le prompting pour guider le comportement du modèle.
Comme Claude Opus 4.7, Claude Opus 4.8 ne prend pas en charge les budgets de réflexion étendue. Définir thinking: {type: "enabled", budget_tokens: N} renvoie une erreur 400.
Le diff suivant met à jour une requête écrite pour Claude Opus 4.6 ou antérieur afin qu'elle fonctionne sur Claude Opus 4.8. Les lignes supprimées (-) définissent l'ancien ID de modèle et le budget de réflexion manuel que Claude Opus 4.8 rejette. Les lignes ajoutées (+) définissent le nouvel ID de modèle, passent à la réflexion adaptative et contrôlent la profondeur de réflexion avec le paramètre effort, passé dans le champ output_config de niveau supérieur. Le modèle détermine quand et combien réfléchir à chaque tour. Si vous supprimez entièrement le champ thinking, les requêtes s'exécutent sans réflexion :
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
- model="claude-opus-4-6",
+ model="claude-opus-4-8",
max_tokens=16000,
- thinking={"type": "enabled", "budget_tokens": 10000},
+ thinking={"type": "adaptive"},
+ output_config={"effort": "high"},
messages=[
{
"role": "user",
"content": "Explain why the sum of two even numbers is always even.",
}
],
)Par rapport à Claude Opus 4.7, Claude Opus 4.8 cible des améliorations comportementales dans :
Avec la réflexion adaptative activée, Claude Opus 4.8 déclenche le raisonnement uniquement lorsqu'il détermine que le tour en a besoin. Sur des recherches simples et des étapes agentiques courtes, il répond directement. Sur des problèmes complexes à plusieurs étapes, il raisonne avant de répondre. Cela réduit les tokens de réflexion gaspillés sur des charges de travail bimodales par rapport à Claude Opus 4.7 au même niveau d'effort. Comme sur Claude Opus 4.7, la réflexion est désactivée sauf si vous définissez explicitement thinking: {type: "adaptive"} dans votre requête.
Il ne s'agit pas de changements cassants de l'API, mais ils peuvent nécessiter des mises à jour de prompts. Consultez Migration vers Claude Opus 4.8 pour des conseils complets.
medium permet un peu plus de réflexion, high un peu moins, et xhigh substantiellement plus. Si vous avez ajusté un niveau d'effort par rapport à Claude Opus 4.7, réétablissez une référence de coût et de latence à ce niveau avant de l'ajuster.Pour des instructions de migration étape par étape et la liste de contrôle complète de migration, consultez Migration vers Claude Opus 4.8. Si vous effectuez une mise à niveau depuis Claude Opus 4.6 ou antérieur, appliquez également les étapes de migration vers Claude Opus 4.7. Ces étapes couvrent des changements cassants que la mise à niveau vers Claude Opus 4.8 seule ne couvre pas. Si vous utilisez Claude Code ou l'Agent SDK, la compétence API Claude peut appliquer automatiquement ces étapes de migration à votre base de code.
Guide pour migrer vers les derniers modèles Claude depuis les versions précédentes de Claude.
Contrôlez le nombre de tokens que Claude utilise lors de ses réponses avec le paramètre effort, en arbitrant entre l'exhaustivité de la réponse et l'efficacité des tokens.
Laissez Claude déterminer dynamiquement quand et combien utiliser la réflexion étendue avec le mode de réflexion adaptative.
Comment les messages système en milieu de conversation préservent les correspondances de cache.
Découvrez ce que signifie chaque valeur de stop_reason et comment gérer la troncature, l'utilisation d'outils, les tours en pause et les refus dans votre application.
Obtenez jusqu'à 2,5 fois plus de tokens de sortie par seconde à partir des modèles Claude Opus.
Was this page helpful?