Níveis de serviço
Diferentes níveis de serviço permitem que você equilibre disponibilidade, desempenho e custos previsíveis com base nas necessidades da sua aplicação.
A Anthropic oferece três "service tiers" (níveis de serviço):
- Priority Tier: Disponível apenas para organizações com um compromisso de capacidade existente
- Standard: Nível padrão tanto para pilotos quanto para escalar casos de uso do dia a dia
- Batch: Melhor para fluxos de trabalho assíncronos que podem esperar ou se beneficiar de estar fora da sua capacidade normal
Standard Tier
O nível standard é o nível de serviço padrão para todas as requisições de API. A API prioriza essas requisições junto com todas as outras requisições com disponibilidade de melhor esforço.
Priority Tier
A API prioriza as requisições neste nível acima de todas as outras requisições. Essa priorização ajuda a minimizar erros de "servidor sobrecarregado", mesmo durante horários de pico.
Para mais informações, consulte Compromissos existentes do Priority Tier.
Como as requisições são atribuídas aos níveis
Ao processar uma requisição, a Anthropic decide atribuir uma requisição ao Priority Tier nos seguintes cenários:
- Sua organização tem capacidade suficiente do Priority Tier em tokens de entrada por minuto
- Sua organização tem capacidade suficiente do Priority Tier em tokens de saída por minuto
A Anthropic contabiliza o uso em relação à capacidade do Priority Tier da seguinte forma:
Tokens de entrada
- Leituras de cache como 0,1 token por token lido do cache
- Escritas de cache como 1,25 token por token escrito no cache com um TTL de 5 minutos
- Escritas de cache como 2,00 tokens por token escrito no cache com um TTL de 1 hora
- Para requisições de inferência somente nos EUA (
inference_geo: "us") nos modelos Claude 4.6 e posteriores, os tokens de entrada são 1,1 token por token - Todos os outros tokens de entrada são 1 token por token
Tokens de saída
- Para requisições de inferência somente nos EUA (
inference_geo: "us") nos modelos Claude 4.6 e posteriores, os tokens de saída são 1,1 token por token - Todos os outros tokens de saída são 1 token por token
Caso contrário, as requisições prosseguem no nível standard.
Usando níveis de serviço
Você pode controlar quais níveis de serviço podem ser usados para uma requisição definindo o parâmetro service_tier:
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-opus-4-8",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello, Claude!"}],
service_tier="auto", # Automatically use Priority Tier when available, fallback to standard
)
print(message.usage.service_tier)O parâmetro service_tier aceita os seguintes valores:
"auto"(padrão) - Usa a capacidade do Priority Tier se disponível, recorrendo à sua outra capacidade caso contrário"standard_only"- Usa apenas a capacidade do nível standard, útil se você não quiser usar sua capacidade do Priority Tier
O objeto usage da resposta também inclui o nível de serviço atribuído à requisição:
{
"usage": {
"input_tokens": 410,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0,
"output_tokens": 585,
"service_tier": "priority"
}
}Isso permite que você determine qual nível de serviço foi atribuído à requisição.
Ao solicitar service_tier="auto" com um modelo que possui um compromisso do Priority Tier, estes cabeçalhos de resposta fornecem informações:
anthropic-priority-input-tokens-limit: 10000
anthropic-priority-input-tokens-remaining: 9618
anthropic-priority-input-tokens-reset: 2025-01-12T23:11:59Z
anthropic-priority-output-tokens-limit: 10000
anthropic-priority-output-tokens-remaining: 6000
anthropic-priority-output-tokens-reset: 2025-01-12T23:12:21ZVocê pode usar a presença desses cabeçalhos para detectar se sua requisição era elegível para o Priority Tier, mesmo que estivesse acima do limite.
Compromissos existentes do Priority Tier
Um compromisso do Priority Tier consiste em:
- Um número de tokens de entrada por minuto
- Um número de tokens de saída por minuto
- Uma duração do compromisso (1, 3, 6 ou 12 meses)
- Uma versão específica de modelo
O Priority Tier tem como meta 99,5% de disponibilidade com recursos computacionais priorizados. Requisições além da sua capacidade contratada recorrem automaticamente ao nível standard.
Modelos suportados
O Priority Tier é suportado em todos os modelos Claude disponíveis, exceto Claude Fable 5.1, Claude Mythos 5.1, Claude Mythos 5, Claude Mythos Preview, Claude Opus 5 e Claude Sonnet 5.
Consulte a Visão geral dos modelos para mais detalhes sobre os modelos disponíveis.
Was this page helpful?