Claude Platform Docs
Referência da APISuporte e configuração

Níveis de serviço

Diferentes níveis de serviço permitem que você equilibre disponibilidade, desempenho e custos previsíveis com base nas necessidades da sua aplicação.

A Anthropic oferece três "service tiers" (níveis de serviço):

  • Priority Tier: Disponível apenas para organizações com um compromisso de capacidade existente
  • Standard: Nível padrão tanto para pilotos quanto para escalar casos de uso do dia a dia
  • Batch: Melhor para fluxos de trabalho assíncronos que podem esperar ou se beneficiar de estar fora da sua capacidade normal

Standard Tier

O nível standard é o nível de serviço padrão para todas as requisições de API. A API prioriza essas requisições junto com todas as outras requisições com disponibilidade de melhor esforço.

Priority Tier

A API prioriza as requisições neste nível acima de todas as outras requisições. Essa priorização ajuda a minimizar erros de "servidor sobrecarregado", mesmo durante horários de pico.

Para mais informações, consulte Compromissos existentes do Priority Tier.

Como as requisições são atribuídas aos níveis

Ao processar uma requisição, a Anthropic decide atribuir uma requisição ao Priority Tier nos seguintes cenários:

  • Sua organização tem capacidade suficiente do Priority Tier em tokens de entrada por minuto
  • Sua organização tem capacidade suficiente do Priority Tier em tokens de saída por minuto

A Anthropic contabiliza o uso em relação à capacidade do Priority Tier da seguinte forma:

Tokens de entrada

  • Leituras de cache como 0,1 token por token lido do cache
  • Escritas de cache como 1,25 token por token escrito no cache com um TTL de 5 minutos
  • Escritas de cache como 2,00 tokens por token escrito no cache com um TTL de 1 hora
  • Para requisições de inferência somente nos EUA (inference_geo: "us") nos modelos Claude 4.6 e posteriores, os tokens de entrada são 1,1 token por token
  • Todos os outros tokens de entrada são 1 token por token

Tokens de saída

  • Para requisições de inferência somente nos EUA (inference_geo: "us") nos modelos Claude 4.6 e posteriores, os tokens de saída são 1,1 token por token
  • Todos os outros tokens de saída são 1 token por token

Caso contrário, as requisições prosseguem no nível standard.

Usando níveis de serviço

Você pode controlar quais níveis de serviço podem ser usados para uma requisição definindo o parâmetro service_tier:

client = anthropic.Anthropic()

message = client.messages.create(
    model="claude-opus-4-8",
    max_tokens=1024,
    messages=[{"role": "user", "content": "Hello, Claude!"}],
    service_tier="auto",  # Automatically use Priority Tier when available, fallback to standard
)
print(message.usage.service_tier)

O parâmetro service_tier aceita os seguintes valores:

  • "auto" (padrão) - Usa a capacidade do Priority Tier se disponível, recorrendo à sua outra capacidade caso contrário
  • "standard_only" - Usa apenas a capacidade do nível standard, útil se você não quiser usar sua capacidade do Priority Tier

O objeto usage da resposta também inclui o nível de serviço atribuído à requisição:

{
  "usage": {
    "input_tokens": 410,
    "cache_creation_input_tokens": 0,
    "cache_read_input_tokens": 0,
    "output_tokens": 585,
    "service_tier": "priority"
  }
}

Isso permite que você determine qual nível de serviço foi atribuído à requisição.

Ao solicitar service_tier="auto" com um modelo que possui um compromisso do Priority Tier, estes cabeçalhos de resposta fornecem informações:

anthropic-priority-input-tokens-limit: 10000
anthropic-priority-input-tokens-remaining: 9618
anthropic-priority-input-tokens-reset: 2025-01-12T23:11:59Z
anthropic-priority-output-tokens-limit: 10000
anthropic-priority-output-tokens-remaining: 6000
anthropic-priority-output-tokens-reset: 2025-01-12T23:12:21Z

Você pode usar a presença desses cabeçalhos para detectar se sua requisição era elegível para o Priority Tier, mesmo que estivesse acima do limite.

Compromissos existentes do Priority Tier

Um compromisso do Priority Tier consiste em:

  • Um número de tokens de entrada por minuto
  • Um número de tokens de saída por minuto
  • Uma duração do compromisso (1, 3, 6 ou 12 meses)
  • Uma versão específica de modelo

O Priority Tier tem como meta 99,5% de disponibilidade com recursos computacionais priorizados. Requisições além da sua capacidade contratada recorrem automaticamente ao nível standard.

Modelos suportados

O Priority Tier é suportado em todos os modelos Claude disponíveis, exceto Claude Fable 5.1, Claude Mythos 5.1, Claude Mythos 5, Claude Mythos Preview, Claude Opus 5 e Claude Sonnet 5.

Consulte a Visão geral dos modelos para mais detalhes sobre os modelos disponíveis.

Was this page helpful?