Claude Platform Docs
Référence APISupport et configuration

Limites de débit

Afin de limiter les abus et de gérer la capacité de l'API, des limites sont en place concernant l'utilisation que peut faire une organisation de l'API Claude.

Il existe deux types de limites :

  1. Les limites de dépenses (spend limits) fixent un coût mensuel maximal qu'une organisation peut engager pour l'utilisation de l'API.
  2. Les limites de débit (rate limits) fixent le nombre maximal de requêtes API qu'une organisation peut effectuer sur une période définie.

L'API applique des limites configurées par le service au niveau de l'organisation, mais vous pouvez également définir des limites configurables par l'utilisateur pour les espaces de travail de votre organisation.

À propos des limites de débit

  • Les limites sont conçues pour prévenir les abus de l'API, tout en minimisant l'impact sur les schémas d'utilisation courants des clients.
  • Les limites sont définies par niveau d'utilisation (usage tier). Les organisations sont placées automatiquement dans un niveau en fonction de leur historique d'utilisation et de la situation de leur compte, et peuvent passer à un niveau supérieur au fil du temps à mesure qu'elles utilisent l'API.
  • Les nouvelles organisations et les organisations ayant un historique d'utilisation limité peuvent commencer dans le niveau Evaluation, avec des limites inférieures aux limites standard indiquées sur cette page pendant que l'historique du compte s'établit. Ces limites de départ font partie des moyens par lesquels Anthropic prévient la fraude et les abus, et elles augmentent automatiquement à mesure que votre organisation construit son historique d'utilisation.
  • Les limites sont définies au niveau de l'organisation. Vous pouvez consulter le niveau de votre organisation et ses limites actuelles sur la page Limites de débit de la Claude Console.
  • Vous pouvez atteindre les limites de débit sur des intervalles de temps plus courts. Par exemple, un débit de 60 requêtes par minute (RPM) peut être appliqué sous la forme d'une requête par seconde. De courtes rafales de requêtes peuvent dépasser la limite et déclencher des erreurs de limite de débit.
  • Les limites suivantes sont les limites standard pour chaque niveau. Si vous avez besoin de limites plus élevées, consultez Demander des limites plus élevées.
  • L'API utilise l'algorithme du seau à jetons (token bucket) pour appliquer les limites de débit. Cela signifie que votre capacité est reconstituée en continu jusqu'à votre limite maximale, plutôt que d'être réinitialisée à intervalles fixes.
  • Toutes les limites décrites ici représentent l'utilisation maximale autorisée, et non des minimums garantis. Ces limites visent à réduire les dépenses excessives involontaires et à garantir une répartition équitable des ressources entre les utilisateurs.

Limites de dépenses

Chacun des niveaux Start, Build et Scale comporte un plafond de dépenses mensuel, qui correspond au montant maximal que votre organisation peut dépenser sur l'API chaque mois calendaire. Vous pouvez consulter le plafond de dépenses mensuel de votre organisation et définir votre propre limite sur la page Facturation.

Niveau d'utilisationPlafond de dépenses mensuel
Start500 $ USD
Build1 000 $ USD
Scale200 000 $ USD

Les organisations du niveau Custom n'ont pas de plafond de dépenses mensuel ; les limites sont convenues avec leur équipe de compte.

Atteindre votre plafond de dépenses

Une fois que vous atteignez le plafond de dépenses de votre niveau, l'utilisation de l'API est suspendue jusqu'à 00:00 UTC le premier jour du mois suivant, sauf si vous demandez une limite plus élevée avant. Pendant que l'utilisation est suspendue, les requêtes API renvoient un code HTTP 429 :

{
  "type": "error",
  "error": {
    "type": "rate_limit_error",
    "message": "You have reached your API usage limits: your organization has crossed its monthly API usage threshold, set based on your organization's API tier. You will regain access on 2026-09-01 at 00:00 UTC.",
    "details": { "error_code": "enforced_spend_limit_reached" }
  },
  "request_id": "req_018EeWyXxfu5pfWkrYcMdjWG"
}
  • Le type d'erreur est rate_limit_error, le même que pour une limite de débit, mais la réponse ne comporte pas d'en-tête retry-after. Les nouvelles tentatives, y compris les tentatives automatiques des SDK, échouent jusqu'à ce que l'accès soit rétabli.
  • Sur l'API Messages, error.details.error_code vaut enforced_spend_limit_reached. Utilisez-le pour distinguer cette réponse d'une limite de débit.
  • Le passage à un niveau supérieur rétablit l'accès ; consultez Demander des limites plus élevées.

Définir votre propre limite de dépenses

Vous pouvez également définir votre propre limite de dépenses en dessous du plafond de votre niveau afin de maîtriser les coûts :

  1. Accéder à la page Facturation

    Rendez-vous dans Settings > Billing dans la Claude Console.

  2. Ouvrir l'éditeur de limite de dépenses

    Dans la section Spend limits, cliquez sur Adjust limit (ou Set limit si aucune limite n'est actuellement définie).

  3. Ajuster votre limite de dépenses

    Saisissez une nouvelle valeur. Votre limite de dépenses ne peut pas dépasser le plafond de votre niveau actuel.

Lorsque l'utilisation atteint une limite de dépenses que vous avez définie, les requêtes renvoient un code HTTP 400 avec le type d'erreur invalid_request_error. Le message commence par You have reached your specified API usage limits, ou par You have reached your specified workspace API usage limits pour une limite d'espace de travail, et indique quand l'accès sera rétabli. Augmentez ou supprimez la limite pour rétablir l'accès plus tôt.

Les limites de l'espace de travail Claude Code sont vérifiées séparément : les requêtes Claude Code dépassant la limite de cet espace de travail peuvent à la place recevoir un code 429 accompagné d'un en-tête retry-after.

Limites de débit

Les limites de débit de l'API Messages sont mesurées en requêtes par minute (RPM), en tokens d'entrée par minute (ITPM) et en tokens de sortie par minute (OTPM) pour chaque classe de modèle. Si vous dépassez l'une des limites de débit, vous recevrez une erreur 429 décrivant quelle limite de débit a été dépassée, accompagnée d'un en-tête retry-after indiquant combien de temps attendre.

ITPM tenant compte du cache

De nombreux fournisseurs d'API utilisent une limite combinée de « tokens par minute » (TPM). Celle-ci peut inclure tous les tokens, mis en cache ou non, en entrée comme en sortie. Pour la plupart des modèles Claude, seuls les tokens d'entrée non mis en cache sont comptabilisés dans vos limites de débit ITPM. Cet avantage clé rend les limites de débit effectivement plus élevées qu'elles ne le paraissent au premier abord.

Les limites de débit ITPM sont estimées au début de chaque requête. L'estimation est ensuite ajustée pendant la requête pour refléter le nombre réel de tokens d'entrée utilisés.

Voici ce qui est comptabilisé dans l'ITPM :

  • input_tokens (tokens situés après le dernier point d'arrêt du cache) ✓ Comptabilisés dans l'ITPM
  • cache_creation_input_tokens (tokens en cours d'écriture dans le cache) ✓ Comptabilisés dans l'ITPM
  • cache_read_input_tokens (tokens lus depuis le cache) ✗ NON comptabilisés dans l'ITPM pour la plupart des modèles

Exemple : avec une limite de 2 000 000 ITPM et un « cache hit rate » (taux de succès du cache) de 80 %, vous pourriez traiter effectivement 10 000 000 de tokens d'entrée au total par minute (2 M non mis en cache + 8 M mis en cache). En effet, les tokens mis en cache ne sont pas comptabilisés dans votre limite de débit.

Pour tirer le meilleur parti de vos limites de débit, mettez en cache le contenu répété : instructions système et prompts, documents de contexte volumineux, définitions d'outils et historique de conversation. Consultez la page mise en cache des prompts pour obtenir des conseils. Une mise en cache efficace vous permet d'augmenter considérablement votre débit réel sans relever vos limites de débit. Surveillez votre taux de succès du cache sur la page Utilisation pour affiner votre stratégie de mise en cache.

Les limites de débit OTPM sont évaluées en temps réel, au fur et à mesure de la production des tokens de sortie. Seuls les tokens réellement générés sont comptabilisés. Le paramètre max_tokens n'entre pas dans le calcul des limites de débit OTPM. Définir une valeur max_tokens plus élevée n'a donc aucun inconvénient en matière de limite de débit.

Les limites de débit s'appliquent séparément à chaque modèle. Vous pouvez donc utiliser simultanément différents modèles, chacun jusqu'à sa propre limite. Vous pouvez consulter vos limites de débit actuelles et leur comportement sur la page Limites de débit de la Claude Console. Vous pouvez aussi lire les limites configurées par programmation avec l'API Rate Limits.

ModèleNombre maximal de requêtes par minute (RPM)Nombre maximal de tokens d'entrée par minute (ITPM)Nombre maximal de tokens de sortie par minute (OTPM)
Claude Fable 5.x11 000500 000100 000
Claude Opus 5.51 0002 000 000400 000
Claude Opus 51 0002 000 000400 000
Claude Opus 4.x21 0002 000 000400 000
Claude Sonnet 51 0002 000 000400 000
Claude Sonnet 4.x31 0002 000 000400 000
Claude Haiku 4.51 0002 000 000400 000
Claude Haiku 3.5 (retiré, sauf sur Bedrock et Google Cloud)1 000100 000420 000

1 La limite de débit de Fable est une limite totale qui s'applique au trafic combiné de Claude Fable 5.1 et de Claude Fable 5. Claude Mythos 5.1 et Claude Mythos 5 partagent une limite combinée distincte, selon les mêmes conditions.

2 La limite de débit d'Opus est une limite totale qui s'applique au trafic combiné de Claude Opus 4.8, Opus 4.7, Opus 4.6 et Opus 4.5. Claude Opus 5.5 et Claude Opus 5 ont chacun une limite de débit distincte et ne font pas partie de ce seau combiné.

3 La limite de débit de Sonnet 4.x est une limite totale qui s'applique au trafic combiné de Sonnet 4.6 et de Sonnet 4.5. Claude Sonnet 5 a une limite de débit distincte et ne fait pas partie de ce seau combiné.

4 Cette limite comptabilise cache_read_input_tokens dans l'utilisation ITPM.

API Message Batches

L'API Message Batches dispose de son propre ensemble de limites de débit, partagées entre tous les modèles. Celles-ci comprennent une limite de requêtes par minute (RPM) pour tous les points de terminaison de l'API et une limite du nombre de requêtes de lot pouvant se trouver simultanément dans la file de traitement. Une « requête de lot » désigne ici une partie d'un Message Batch. Vous pouvez créer un Message Batch contenant des milliers de requêtes de lot, chacune étant comptabilisée dans cette limite. Une requête de lot est considérée comme faisant partie de la file de traitement tant qu'elle n'a pas encore été traitée avec succès par le modèle.

Nombre maximal de requêtes par minute (RPM)Nombre maximal de requêtes de lot dans la file de traitementNombre maximal de requêtes de lot par lot
1 000200 000100 000

Managed Agents

Les points de terminaison Claude Managed Agents sont soumis à des limites de débit par organisation. Ces limites sont distinctes des limites de débit de l'API Messages ci-dessus.

OpérationLimite
Points de terminaison de création (par exemple, agents, sessions et environnements)300 requêtes par minute
Points de terminaison de lecture (par exemple, récupération, liste et streaming)1 200 requêtes par minute

API Files

Les requêtes de l'API Files disposent de leur propre limite par organisation, partagée entre les opérations de téléversement, de liste, de récupération, de téléchargement et de suppression, et distincte des limites de l'API Messages décrites plus haut sur cette page. Consultez Limites de débit de l'API Files pour connaître la valeur actuelle.

Limites de débit du mode rapide

Lorsque vous utilisez le « fast mode » (mode rapide) (aperçu de recherche) avec speed: "fast" sur Claude Opus 5.5, Claude Opus 5, ou Opus 4.8, des limites de débit dédiées s'appliquent, distinctes des limites de débit standard d'Opus. En cas de dépassement des limites de débit du mode rapide, l'API renvoie une erreur 429 avec un en-tête retry-after. Le mode rapide n'est pas disponible sur Claude Opus 4.7 (les requêtes renvoient une erreur) ni sur Claude Opus 4.6 (les requêtes vers claude-opus-4-6 avec speed: "fast" s'exécutent à vitesse standard). Consultez Mode rapide.

La réponse inclut des en-têtes anthropic-fast-* qui indiquent l'état de vos limites de débit du mode rapide. Consultez Limites de débit du mode rapide pour plus de détails sur ces en-têtes.

Surveiller vos limites de débit dans la Console

Vous pouvez surveiller votre utilisation des limites de débit sur la page Utilisation de la Claude Console.

En plus de fournir des graphiques de tokens et de requêtes, la page Utilisation propose deux graphiques distincts de limites de débit. Utilisez ces graphiques pour voir la marge dont vous disposez pour croître, identifier les moments où vous atteignez peut-être un pic d'utilisation, comprendre quelles limites de débit demander et apprendre comment améliorer vos taux de mise en cache. Les graphiques présentent un certain nombre de métriques pour une limite de débit donnée (par exemple, par modèle) :

  • Le graphique Rate Limit - Input Tokens (limite de débit - tokens d'entrée) comprend :
    • Le maximum horaire de tokens d'entrée non mis en cache par minute
    • Votre limite de débit actuelle en tokens d'entrée par minute
    • Le taux de cache de vos tokens d'entrée (c'est-à-dire le pourcentage de tokens d'entrée lus depuis le cache)
  • Le graphique Rate Limit - Output Tokens (limite de débit - tokens de sortie) comprend :
    • Le maximum horaire de tokens de sortie par minute
    • Votre limite de débit actuelle en tokens de sortie par minute

Demander des limites plus élevées

Pour demander des limites de débit plus élevées ou un plafond de dépenses mensuel plus élevé, utilisez Request rate limit increase sur la page Limites de débit. Le support Anthropic peut également relever les limites ; pour les besoins urgents, contactez le support Anthropic.

Définir des limites inférieures pour les espaces de travail

Pour en savoir plus sur les espaces de travail, consultez Espaces de travail.

Pour protéger les espaces de travail de votre organisation contre une éventuelle surutilisation, vous pouvez définir des limites de dépenses et de débit personnalisées par espace de travail.

Exemple : si la limite de votre organisation est de 40 000 tokens d'entrée par minute et de 8 000 tokens de sortie par minute, vous pourriez limiter un espace de travail à 30 000 tokens d'entrée par minute. Cela protège les autres espaces de travail d'une éventuelle surutilisation et garantit une répartition plus équitable des ressources au sein de votre organisation. Les tokens par minute restants non utilisés (ou davantage, si cet espace de travail n'utilise pas sa limite) sont alors disponibles pour les autres espaces de travail.

Remarque :

  • Vous ne pouvez pas définir de limites sur l'espace de travail par défaut.
  • Si elles ne sont pas définies, les limites de l'espace de travail correspondent à la limite de l'organisation.
  • Les limites des espaces de travail sont définies par type de limiteur (par exemple, requêtes par minute, tokens d'entrée par minute ou tokens de sortie par minute).
  • Les limites à l'échelle de l'organisation s'appliquent toujours, même si la somme des limites des espaces de travail est supérieure.

Pour lire par programmation les limites de débit actuelles de votre organisation et de vos espaces de travail, utilisez l'API Rate Limits.

En-têtes de réponse

La réponse de l'API inclut des en-têtes qui vous indiquent la limite de débit appliquée, l'utilisation actuelle et le moment où la limite sera réinitialisée.

Les en-têtes suivants sont renvoyés :

En-têteDescription
retry-afterLe nombre de secondes à attendre avant de pouvoir réessayer la requête. Les tentatives anticipées échoueront. Non envoyé avec le code 429 du plafond de dépenses (voir Atteindre votre plafond de dépenses).
anthropic-ratelimit-requests-limitLe nombre maximal de requêtes autorisées au cours d'une période de limite de débit.
anthropic-ratelimit-requests-remainingLe nombre de requêtes restantes avant d'être soumis à la limite de débit.
anthropic-ratelimit-requests-resetLe moment où la limite de débit des requêtes sera entièrement reconstituée, fourni au format RFC 3339.
anthropic-ratelimit-tokens-limitLe nombre maximal de tokens autorisés au cours d'une période de limite de débit.
anthropic-ratelimit-tokens-remainingLe nombre de tokens restants (arrondi au millier le plus proche) avant d'être soumis à la limite de débit.
anthropic-ratelimit-tokens-resetLe moment où la limite de débit des tokens sera entièrement reconstituée, fourni au format RFC 3339.
anthropic-ratelimit-input-tokens-limitLe nombre maximal de tokens d'entrée autorisés au cours d'une période de limite de débit.
anthropic-ratelimit-input-tokens-remainingLe nombre de tokens d'entrée restants (arrondi au millier le plus proche) avant d'être soumis à la limite de débit.
anthropic-ratelimit-input-tokens-resetLe moment où la limite de débit des tokens d'entrée sera entièrement reconstituée, fourni au format RFC 3339.
anthropic-ratelimit-output-tokens-limitLe nombre maximal de tokens de sortie autorisés au cours d'une période de limite de débit.
anthropic-ratelimit-output-tokens-remainingLe nombre de tokens de sortie restants (arrondi au millier le plus proche) avant d'être soumis à la limite de débit.
anthropic-ratelimit-output-tokens-resetLe moment où la limite de débit des tokens de sortie sera entièrement reconstituée, fourni au format RFC 3339.
anthropic-priority-input-tokens-limitLe nombre maximal de tokens d'entrée Priority Tier autorisés au cours d'une période de limite de débit. (Priority Tier uniquement)
anthropic-priority-input-tokens-remainingLe nombre de tokens d'entrée Priority Tier restants (arrondi au millier le plus proche) avant d'être soumis à la limite de débit. (Priority Tier uniquement)
anthropic-priority-input-tokens-resetLe moment où la limite de débit des tokens d'entrée Priority Tier sera entièrement reconstituée, fourni au format RFC 3339. (Priority Tier uniquement)
anthropic-priority-output-tokens-limitLe nombre maximal de tokens de sortie Priority Tier autorisés au cours d'une période de limite de débit. (Priority Tier uniquement)
anthropic-priority-output-tokens-remainingLe nombre de tokens de sortie Priority Tier restants (arrondi au millier le plus proche) avant d'être soumis à la limite de débit. (Priority Tier uniquement)
anthropic-priority-output-tokens-resetLe moment où la limite de débit des tokens de sortie Priority Tier sera entièrement reconstituée, fourni au format RFC 3339. (Priority Tier uniquement)

Les en-têtes anthropic-ratelimit-tokens-* affichent les valeurs de la limite la plus restrictive actuellement en vigueur. Par exemple, si vous avez dépassé la limite de tokens par minute de l'espace de travail, les en-têtes contiendront les valeurs de la limite de débit de tokens par minute de l'espace de travail. Si les limites de l'espace de travail ne s'appliquent pas, les en-têtes renverront le total des tokens restants, le total étant la somme des tokens d'entrée et de sortie. Cette approche vous garantit une visibilité sur la contrainte la plus pertinente pour votre utilisation actuelle de l'API. Pour savoir sur quel espace de travail une requête a été comptabilisée, lisez l'en-tête de réponse anthropic-workspace-id, qui contient l'identifiant de l'espace de travail auquel votre clé API ou votre jeton d'accès a été résolu.

Was this page helpful?