Anthropic propose trois niveaux de service :
Le niveau standard est le niveau de service par défaut pour toutes les requêtes API. L'API priorise ces requêtes aux côtés de toutes les autres requêtes avec une disponibilité au mieux.
L'API priorise les requêtes de ce niveau par rapport à toutes les autres requêtes. Cette priorisation aide à minimiser les erreurs « server overloaded », même pendant les périodes de pointe.
Pour plus d'informations, consultez Engagements Priority Tier existants.
Lors du traitement d'une requête, Anthropic décide d'assigner une requête au Priority Tier dans les scénarios suivants :
Anthropic comptabilise l'utilisation par rapport à la capacité Priority Tier comme suit :
Tokens d'entrée
inference_geo: "us") sur les modèles Claude 4.6 et ultérieurs, les tokens d'entrée comptent pour 1,1 token par tokenTokens de sortie
inference_geo: "us") sur les modèles Claude 4.6 et ultérieurs, les tokens de sortie comptent pour 1,1 token par tokenSinon, les requêtes sont traitées au niveau standard.
Vous pouvez contrôler quels niveaux de service peuvent être utilisés pour une requête en définissant le paramètre service_tier :
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-opus-4-8",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello, Claude!"}],
service_tier="auto", # Automatically use Priority Tier when available, fallback to standard
)
print(message.usage.service_tier)Le paramètre service_tier accepte les valeurs suivantes :
"auto" (par défaut) - Utilise la capacité Priority Tier si elle est disponible, avec repli sur votre autre capacité sinon"standard_only" - Utilise uniquement la capacité du niveau standard, utile si vous ne souhaitez pas utiliser votre capacité Priority TierL'objet usage de la réponse inclut également le niveau de service assigné à la requête :
{
"usage": {
"input_tokens": 410,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0,
"output_tokens": 585,
"service_tier": "priority"
}
}Cela vous permet de déterminer quel niveau de service a été assigné à la requête.
Lorsque vous demandez service_tier="auto" avec un modèle disposant d'un engagement Priority Tier, ces en-têtes de réponse fournissent des informations :
anthropic-priority-input-tokens-limit: 10000
anthropic-priority-input-tokens-remaining: 9618
anthropic-priority-input-tokens-reset: 2025-01-12T23:11:59Z
anthropic-priority-output-tokens-limit: 10000
anthropic-priority-output-tokens-remaining: 6000
anthropic-priority-output-tokens-reset: 2025-01-12T23:12:21ZVous pouvez utiliser la présence de ces en-têtes pour détecter si votre requête était éligible au Priority Tier, même si elle dépassait la limite.
Un engagement Priority Tier se compose de :
Le Priority Tier vise une disponibilité de 99,5 % avec des ressources de calcul priorisées. Les requêtes au-delà de votre capacité engagée basculent automatiquement vers le niveau standard.
Le Priority Tier est pris en charge sur tous les modèles Claude disponibles à l'exception de Claude Mythos 5, Claude Mythos Preview, Claude Opus 5 et Claude Sonnet 5.
Consultez la vue d'ensemble des modèles pour plus de détails sur les modèles disponibles.
Was this page helpful?