Claude Platform Docs
MessagesCapacités du modèle

Mode rapide (aperçu de recherche)

Obtenez jusqu'à 2,5 fois plus de tokens de sortie par seconde avec les modèles Claude Opus pris en charge.

Le « fast mode » (mode rapide) offre jusqu'à 2,5 fois plus de tokens de sortie par seconde avec Claude Opus 5.5, Claude Opus 5, et Claude Opus 4.8, à un tarif premium. Pour l'activer, définissez speed: "fast" dans votre requête et ajoutez l'en-tête bêta fast-mode-2026-02-01.

Modèles pris en charge

Le mode rapide est pris en charge sur les modèles suivants :

  • Claude Opus 5.5 ()
  • Claude Opus 5 ()
  • Claude Opus 4.8 ()

Fonctionnement du mode rapide

Le mode rapide exécute le même modèle avec une configuration d'inférence plus rapide. Il n'y a aucun changement en matière d'intelligence ou de capacités.

  • Jusqu'à 2,5 fois plus de tokens de sortie par seconde par rapport à la vitesse standard
  • Les gains de vitesse portent sur les « output tokens per second » (tokens de sortie par seconde), ou OTPS, et non sur le « time to first token » (délai avant le premier token), ou TTFT
  • Mêmes poids de modèle et même comportement (il ne s'agit pas d'un modèle différent)
  • Compatible avec le streaming, où le gain en OTPS est le plus visible

Utilisation de base

client = anthropic.Anthropic()

response = client.beta.messages.create(
    model="claude-opus-5-5",
    max_tokens=4096,
    speed="fast",
    betas=["fast-mode-2026-02-01"],
    messages=[
        {"role": "user", "content": "Refactor this module to use dependency injection"}
    ],
)

for block in response.content:
    if block.type == "text":
        print(block.text)

Tarification

Le mode rapide est facturé selon un multiplicateur appliqué aux tarifs standard sur l'ensemble de la fenêtre de contexte, y compris pour les requêtes dépassant 200 000 tokens d'entrée. Le tableau suivant présente la tarification du mode rapide pour les modèles pris en charge :

ModèleEntréeSortie
Claude Opus 5.58 $ USD / MTok40 $ USD / MTok
Claude Opus 5 / Claude Opus 4.810 $ USD / MTok50 $ USD / MTok

La tarification du mode rapide se cumule avec les autres modificateurs de prix :

Pour obtenir tous les détails sur la tarification, consultez la page Tarification.

Limites de débit

Le mode rapide dispose d'une « rate limit » (limite de débit) dédiée, distincte des limites de débit standard d'Opus. Lorsque votre limite de débit du mode rapide est dépassée, l'API renvoie une erreur 429 avec un en-tête retry-after indiquant quand la capacité sera disponible.

La réponse inclut des en-têtes qui indiquent l'état de votre limite de débit du mode rapide :

En-têteDescription
anthropic-fast-input-tokens-limitNombre maximal de tokens d'entrée en mode rapide par minute
anthropic-fast-input-tokens-remainingTokens d'entrée en mode rapide restants
anthropic-fast-input-tokens-resetHeure à laquelle la limite de tokens d'entrée en mode rapide est réinitialisée
anthropic-fast-output-tokens-limitNombre maximal de tokens de sortie en mode rapide par minute
anthropic-fast-output-tokens-remainingTokens de sortie en mode rapide restants
anthropic-fast-output-tokens-resetHeure à laquelle la limite de tokens de sortie en mode rapide est réinitialisée

Pour connaître les limites de débit propres à chaque niveau, consultez la page Limites de débit.

Vérifier quelle vitesse a été utilisée

L'objet usage de la réponse inclut un champ speed qui indique quelle vitesse a été utilisée, soit "fast", soit "standard". Demander speed: "fast" sur un modèle qui ne prend pas en charge le mode rapide renvoie une erreur, tout comme le dépassement des limites de débit ou de la capacité du mode rapide (une erreur 429 ou 529). Lorsqu'une requête avec speed: "fast" réussit, usage.speed vaut "fast". Si vous utilisez Claude Opus 4.6 et demandez le mode rapide, son comportement est particulier. Au lieu de renvoyer une erreur comme les autres modèles qui ne prennent pas en charge le mode rapide, il bascule silencieusement vers la vitesse standard. Bien qu'il n'y ait pas d'erreur avec Opus 4.6, le champ speed indique correctement "standard".

client = anthropic.Anthropic()

response = client.beta.messages.create(
    model="claude-opus-5-5",
    max_tokens=1024,
    speed="fast",
    betas=["fast-mode-2026-02-01"],
    messages=[{"role": "user", "content": "Hello"}],
)

print(response.usage.speed)  # "fast" or "standard"
Output
{
  "id": "msg_01XFDUDYJgAACzvnptvVoYEL",
  "type": "message",
  "role": "assistant",

  "usage": {
    "input_tokens": 8,
    "output_tokens": 12,
    "speed": "fast"
  }
}

Pour suivre l'utilisation et les coûts du mode rapide dans l'ensemble de votre organisation, consultez l'API d'utilisation et de coûts.

Nouvelles tentatives et repli

Nouvelles tentatives automatiques

Lorsque les limites de débit du mode rapide sont dépassées, l'API renvoie une erreur 429 avec un en-tête retry-after. Les SDK Anthropic relancent automatiquement ces requêtes jusqu'à 2 fois par défaut (configurable avec max_retries), en attendant le délai spécifié par le serveur avant chaque nouvelle tentative. Comme le mode rapide utilise un réapprovisionnement continu des tokens, le délai retry-after est généralement court et les requêtes aboutissent dès que de la capacité est disponible.

Repli vers la vitesse standard

Si vous préférez basculer vers la vitesse standard plutôt que d'attendre que de la capacité du mode rapide se libère, interceptez l'erreur de limite de débit et relancez la requête sans speed: "fast". Définissez max_retries sur 0 pour la requête rapide initiale afin d'ignorer les nouvelles tentatives automatiques et d'échouer immédiatement en cas d'erreur de limite de débit.

Comme définir max_retries sur 0 désactive également les nouvelles tentatives pour d'autres erreurs transitoires (surcharge, erreurs internes du serveur), les exemples suivants relancent la requête d'origine avec les nouvelles tentatives par défaut dans ces cas.

client = anthropic.Anthropic()


def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
    try:
        return client.with_options(max_retries=max_retries).beta.messages.create(
            **params
        )
    except anthropic.RateLimitError:
        if params.get("speed") == "fast":
            del params["speed"]
            return create_message_with_fast_fallback(max_retries=max_retries, **params)
        raise
    except (
        anthropic.APIStatusError,
        anthropic.APIConnectionError,
    ) as error:
        if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
            raise
        if max_attempts > 1:
            return create_message_with_fast_fallback(
                max_retries=max_retries, max_attempts=max_attempts - 1, **params
            )
        raise


message = create_message_with_fast_fallback(
    model="claude-opus-5-5",
    max_tokens=1024,
    messages=[{"role": "user", "content": "Hello"}],
    betas=["fast-mode-2026-02-01"],
    speed="fast",
    max_retries=0,
)

Points à prendre en compte

  • Mise en cache des prompts : le passage de la vitesse rapide à la vitesse standard, ou inversement, invalide le cache de prompts. Les requêtes exécutées à des vitesses différentes ne partagent pas les préfixes mis en cache.
  • Modèles pris en charge : le mode rapide est pris en charge sur Claude Opus 5.5, Claude Opus 5, et Claude Opus 4.8. Consultez Modèles pris en charge.
  • TTFT : les avantages du mode rapide portent sur les tokens de sortie par seconde (OTPS), et non sur le délai avant le premier token (TTFT).
  • API Batch : le mode rapide n'est pas disponible avec l'API Batch.
  • Priority Tier : le mode rapide n'est pas disponible avec un engagement Priority Tier.
  • Claude Platform on AWS : le mode rapide n'est actuellement pas disponible sur Claude Platform on AWS.

Étapes suivantes

Obtenez des résultats JSON validés à partir de flux de travail d'agents.

Découvrez la structure tarifaire d'Anthropic pour les modèles et les fonctionnalités.

Contrôlez le nombre de tokens que Claude utilise pour répondre grâce au paramètre effort, en arbitrant entre l'exhaustivité de la réponse et l'efficacité en tokens.

Diffusez les réponses de l'API Messages de manière incrémentale avec des événements envoyés par le serveur, y compris le texte, l'utilisation d'outils et les deltas de réflexion étendue.

Was this page helpful?