Niveaux de service
Différents niveaux de service vous permettent d'équilibrer la disponibilité, les performances et la prévisibilité des coûts en fonction des besoins de votre application.
Anthropic propose trois « service tiers » (niveaux de service) :
- Priority Tier : disponible uniquement pour les organisations disposant d'un engagement de capacité existant
- Standard : niveau par défaut, aussi bien pour les phases pilotes que pour la montée en charge des cas d'usage courants
- Batch : idéal pour les flux de travail asynchrones qui peuvent attendre ou qui bénéficient d'être traités en dehors de votre capacité normale
Niveau standard
Le niveau standard est le niveau de service par défaut pour toutes les requêtes API. L'API priorise ces requêtes au même titre que toutes les autres requêtes, avec une disponibilité au mieux (best-effort).
Priority Tier
L'API priorise les requêtes de ce niveau par rapport à toutes les autres requêtes. Cette priorisation contribue à minimiser les erreurs « server overloaded », même pendant les périodes de pointe.
Pour plus d'informations, consultez Engagements Priority Tier existants.
Comment les niveaux sont attribués aux requêtes
Lors du traitement d'une requête, Anthropic décide d'attribuer une requête au Priority Tier dans les scénarios suivants :
- Votre organisation dispose d'une capacité Priority Tier suffisante en tokens d'entrée par minute
- Votre organisation dispose d'une capacité Priority Tier suffisante en tokens de sortie par minute
Anthropic comptabilise l'utilisation par rapport à la capacité Priority Tier comme suit :
Tokens d'entrée
- Les lectures du cache comptent pour 0,1 token par token lu depuis le cache
- Les écritures dans le cache comptent pour 1,25 token par token écrit dans le cache avec un TTL de 5 minutes
- Les écritures dans le cache comptent pour 2,00 tokens par token écrit dans le cache avec un TTL de 1 heure
- Pour les requêtes en inférence aux États-Unis uniquement (
inference_geo: "us") sur les modèles Claude 4.6 et ultérieurs, les tokens d'entrée comptent pour 1,1 token par token - Tous les autres tokens d'entrée comptent pour 1 token par token
Tokens de sortie
- Pour les requêtes en inférence aux États-Unis uniquement (
inference_geo: "us") sur les modèles Claude 4.6 et ultérieurs, les tokens de sortie comptent pour 1,1 token par token - Tous les autres tokens de sortie comptent pour 1 token par token
Dans le cas contraire, les requêtes sont traitées au niveau standard.
Utilisation des niveaux de service
Vous pouvez contrôler quels niveaux de service peuvent être utilisés pour une requête en définissant le paramètre service_tier :
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-opus-4-8",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello, Claude!"}],
service_tier="auto", # Automatically use Priority Tier when available, fallback to standard
)
print(message.usage.service_tier)Le paramètre service_tier accepte les valeurs suivantes :
"auto"(par défaut) - Utilise la capacité Priority Tier si elle est disponible, et se rabat sur votre autre capacité dans le cas contraire"standard_only"- Utilise uniquement la capacité du niveau standard, utile si vous ne souhaitez pas utiliser votre capacité Priority Tier
L'objet usage de la réponse inclut également le niveau de service attribué à la requête :
{
"usage": {
"input_tokens": 410,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0,
"output_tokens": 585,
"service_tier": "priority"
}
}Cela vous permet de déterminer quel niveau de service a été attribué à la requête.
Lorsque vous demandez service_tier="auto" avec un modèle faisant l'objet d'un engagement Priority Tier, ces en-têtes de réponse fournissent des informations :
anthropic-priority-input-tokens-limit: 10000
anthropic-priority-input-tokens-remaining: 9618
anthropic-priority-input-tokens-reset: 2025-01-12T23:11:59Z
anthropic-priority-output-tokens-limit: 10000
anthropic-priority-output-tokens-remaining: 6000
anthropic-priority-output-tokens-reset: 2025-01-12T23:12:21ZVous pouvez utiliser la présence de ces en-têtes pour détecter si votre requête était éligible au Priority Tier, même si elle dépassait la limite.
Engagements Priority Tier existants
Un engagement Priority Tier se compose de :
- Un nombre de tokens d'entrée par minute
- Un nombre de tokens de sortie par minute
- Une durée d'engagement (1, 3, 6 ou 12 mois)
- Une version de modèle spécifique
Priority Tier vise une disponibilité de 99,5 % avec des ressources de calcul priorisées. Les requêtes dépassant votre capacité engagée se rabattent automatiquement sur le niveau standard.
Modèles pris en charge
Priority Tier est pris en charge sur tous les modèles Claude disponibles, à l'exception de Claude Fable 5.1, Claude Mythos 5.1, Claude Mythos 5, Claude Mythos Preview, Claude Opus 5.5, Claude Opus 5 et Claude Sonnet 5.
Consultez la présentation des modèles pour plus de détails sur les modèles disponibles.
Was this page helpful?