A Anthropic oferece três níveis de serviço:
O nível standard é o nível de serviço padrão para todas as requisições de API. A API prioriza essas requisições junto com todas as outras requisições com disponibilidade de melhor esforço.
A API prioriza as requisições neste nível sobre todas as outras requisições. Essa priorização ajuda a minimizar erros de "server overloaded", mesmo durante horários de pico.
Para mais informações, consulte Compromissos existentes do Priority Tier.
Ao lidar com uma requisição, a Anthropic decide atribuir uma requisição ao Priority Tier nos seguintes cenários:
A Anthropic contabiliza o uso contra a capacidade do Priority Tier da seguinte forma:
Tokens de entrada
inference_geo: "us") nos modelos Claude 4.6 e posteriores, os tokens de entrada são 1,1 tokens por tokenTokens de saída
inference_geo: "us") nos modelos Claude 4.6 e posteriores, os tokens de saída são 1,1 tokens por tokenCaso contrário, as requisições prosseguem no nível standard.
Você pode controlar quais níveis de serviço podem ser usados para uma requisição definindo o parâmetro service_tier:
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-opus-4-8",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello, Claude!"}],
service_tier="auto", # Automatically use Priority Tier when available, fallback to standard
)
print(message.usage.service_tier)O parâmetro service_tier aceita os seguintes valores:
"auto" (padrão) - Usa a capacidade do Priority Tier se disponível, recorrendo à sua outra capacidade caso contrário"standard_only" - Usa apenas a capacidade do nível standard, útil se você não quiser usar sua capacidade do Priority TierO objeto usage da resposta também inclui o nível de serviço atribuído à requisição:
{
"usage": {
"input_tokens": 410,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0,
"output_tokens": 585,
"service_tier": "priority"
}
}Isso permite que você determine qual nível de serviço foi atribuído à requisição.
Ao solicitar service_tier="auto" com um modelo com um compromisso de Priority Tier, estes cabeçalhos de resposta fornecem informações:
anthropic-priority-input-tokens-limit: 10000
anthropic-priority-input-tokens-remaining: 9618
anthropic-priority-input-tokens-reset: 2025-01-12T23:11:59Z
anthropic-priority-output-tokens-limit: 10000
anthropic-priority-output-tokens-remaining: 6000
anthropic-priority-output-tokens-reset: 2025-01-12T23:12:21ZVocê pode usar a presença desses cabeçalhos para detectar se sua requisição era elegível para o Priority Tier, mesmo que tenha excedido o limite.
Um compromisso de Priority Tier consiste em:
O Priority Tier tem como meta 99,5% de disponibilidade com recursos computacionais priorizados. Requisições além da sua capacidade comprometida recorrem automaticamente ao nível standard.
O Priority Tier é suportado em todos os modelos Claude disponíveis, exceto Claude Mythos 5, Claude Mythos Preview, Claude Opus 5 e Claude Sonnet 5.
Consulte a Visão geral dos modelos para mais detalhes sobre os modelos disponíveis.
Was this page helpful?