Claude Platform Docs
Referência da APISuporte e configuração

Limites de taxa

Para mitigar o uso indevido e gerenciar a capacidade da API, existem limites sobre o quanto uma organização pode usar a Claude API.

Existem dois tipos de limites:

  1. "Spend limits" (limites de gastos) definem um custo mensal máximo que uma organização pode incorrer pelo uso da API.
  2. "Rate limits" (limites de taxa) definem o número máximo de requisições à API que uma organização pode fazer em um período de tempo definido.

A API aplica limites configurados pelo serviço no nível da organização, mas você também pode definir limites configuráveis pelo usuário para os workspaces da sua organização.

Sobre os limites de taxa

  • Os limites são projetados para prevenir o abuso da API, minimizando o impacto nos padrões de uso comuns dos clientes.
  • Os limites são definidos por "usage tier" (nível de uso). As organizações são colocadas em um nível automaticamente com base no histórico de uso e na situação da conta, e podem passar para um nível mais alto ao longo do tempo à medida que usam a API.
  • Novas organizações e organizações com histórico de uso limitado podem começar no nível Evaluation, com limites abaixo dos limites padrão mostrados nesta página enquanto o histórico da conta é estabelecido. Esses limites iniciais fazem parte de como a Anthropic previne fraudes e abusos, e aumentam automaticamente à medida que sua organização constrói um histórico de uso.
  • Os limites são definidos no nível da organização. Você pode ver o nível e os limites atuais da sua organização na página Limites de taxa no Claude Console.
  • Você pode atingir limites de taxa em intervalos de tempo mais curtos. Por exemplo, uma taxa de 60 requisições por minuto (RPM) pode ser aplicada como 1 requisição por segundo. Rajadas curtas de requisições podem exceder o limite e acionar erros de limite de taxa.
  • Os limites a seguir são os limites padrão para cada nível. Se você precisar de limites mais altos, consulte Solicitando limites mais altos.
  • A API usa o algoritmo "token bucket" (balde de tokens) para aplicar limites de taxa. Isso significa que sua capacidade é continuamente reabastecida até o seu limite máximo, em vez de ser redefinida em intervalos fixos.
  • Todos os limites descritos aqui representam o uso máximo permitido, não mínimos garantidos. Esses limites têm como objetivo reduzir gastos excessivos não intencionais e garantir uma distribuição justa de recursos entre os usuários.

Limites de gastos

Cada um dos níveis Start, Build e Scale possui um teto de gastos mensal, que é o máximo que sua organização pode gastar na API em cada mês do calendário. Você pode visualizar o teto de gastos mensal da sua organização e definir seu próprio limite na página Faturamento.

Nível de usoTeto de gastos mensal
Start$500 USD
Build$1.000 USD
Scale$200.000 USD

As organizações no nível Custom não têm teto de gastos mensal; os limites são acordados com sua equipe de conta.

Atingindo seu teto de gastos

Quando você atinge o teto de gastos do seu nível, o uso da API é pausado até 00:00 UTC do primeiro dia do mês seguinte, a menos que você solicite um limite mais alto antes disso. Enquanto o uso está pausado, as requisições à API retornam HTTP 429:

{
  "type": "error",
  "error": {
    "type": "rate_limit_error",
    "message": "You have reached your API usage limits: your organization has crossed its monthly API usage threshold, set based on your organization's API tier. You will regain access on 2026-09-01 at 00:00 UTC.",
    "details": { "error_code": "enforced_spend_limit_reached" }
  },
  "request_id": "req_018EeWyXxfu5pfWkrYcMdjWG"
}
  • O tipo de erro é rate_limit_error, o mesmo de um limite de taxa, mas a resposta não tem o cabeçalho retry-after. Novas tentativas, incluindo as tentativas automáticas dos SDKs, falham até que o acesso seja retomado.
  • Na Messages API, error.details.error_code é enforced_spend_limit_reached. Use-o para distinguir essa resposta de um limite de taxa.
  • Passar para um nível mais alto restaura o acesso; consulte Solicitando limites mais altos.

Definindo seu próprio limite de gastos

Você também pode definir seu próprio limite de gastos abaixo do teto do seu nível para controlar custos:

  1. Navegue até a página de Faturamento

    Acesse Settings > Billing no Claude Console.

  2. Abra o editor de limite de gastos

    Na seção Spend limits, clique em Adjust limit (ou Set limit se nenhum limite estiver definido no momento).

  3. Ajuste seu limite de gastos

    Insira um novo valor. Seu limite de gastos não pode exceder o teto do seu nível atual.

Quando o uso atinge um limite de gastos definido por você, as requisições retornam HTTP 400 com o tipo de erro invalid_request_error. A mensagem começa com You have reached your specified API usage limits, ou You have reached your specified workspace API usage limits para um limite de workspace, e informa quando o acesso será retomado. Aumente ou remova o limite para restaurar o acesso mais cedo.

Os limites no workspace do Claude Code são verificados separadamente: requisições do Claude Code acima do limite desse workspace podem, em vez disso, receber um 429 que contém um cabeçalho retry-after.

Limites de taxa

Os limites de taxa da Messages API são medidos em requisições por minuto (RPM), tokens de entrada por minuto (ITPM) e tokens de saída por minuto (OTPM) para cada classe de modelo. Se você exceder qualquer um dos limites de taxa, receberá um erro 429 descrevendo qual limite de taxa foi excedido, junto com um cabeçalho retry-after indicando quanto tempo esperar.

ITPM com reconhecimento de cache

Muitos provedores de API usam um limite combinado de "tokens per minute" (tokens por minuto), ou TPM, que pode incluir todos os tokens, tanto em cache quanto não em cache, de entrada e de saída. Para a maioria dos modelos Claude, apenas os tokens de entrada não armazenados em cache contam para seus limites de taxa de ITPM. Esta é uma vantagem fundamental que torna os limites de taxa efetivamente mais altos do que podem parecer inicialmente.

Os limites de taxa de ITPM são estimados no início de cada requisição, e a estimativa é ajustada durante a requisição para refletir o número real de tokens de entrada usados.

Veja o que conta para o ITPM:

  • input_tokens (tokens após o último ponto de interrupção de cache) ✓ Contam para o ITPM
  • cache_creation_input_tokens (tokens sendo gravados no cache) ✓ Contam para o ITPM
  • cache_read_input_tokens (tokens lidos do cache) ✗ NÃO contam para o ITPM na maioria dos modelos

Exemplo: Com um limite de 2.000.000 ITPM e uma taxa de acerto de cache de 80%, você poderia processar efetivamente 10.000.000 de tokens de entrada totais por minuto (2M não em cache + 8M em cache), porque os tokens em cache não contam para seu limite de taxa.

Para aproveitar ao máximo seus limites de taxa, armazene em cache conteúdo repetido, como instruções do sistema e prompts, documentos de contexto grandes, definições de ferramentas e histórico de conversas; consulte cache de prompt para orientações. Com um cache eficaz, você pode aumentar substancialmente sua taxa de transferência real sem aumentar seus limites de taxa. Monitore sua taxa de acerto de cache na página de Uso para ajustar sua estratégia de cache.

Os limites de taxa de OTPM são avaliados em tempo real à medida que os tokens de saída são produzidos, contando apenas os tokens realmente gerados. O parâmetro max_tokens não é considerado nos cálculos de limite de taxa de OTPM, portanto não há desvantagem em termos de limite de taxa ao definir um valor mais alto de max_tokens.

Os limites de taxa são aplicados separadamente para cada modelo; portanto, você pode usar diferentes modelos até seus respectivos limites simultaneamente. Você pode verificar seus limites de taxa atuais e seu comportamento na página Limites de taxa no Claude Console, ou ler os limites configurados programaticamente com a Rate Limits API.

ModeloMáximo de requisições por minuto (RPM)Máximo de tokens de entrada por minuto (ITPM)Máximo de tokens de saída por minuto (OTPM)
Claude Fable 5.x11.000500.000100.000
Claude Opus 5.51.0002.000.000400.000
Claude Opus 51.0002.000.000400.000
Claude Opus 4.x21.0002.000.000400.000
Claude Sonnet 5.51.0002.000.000400.000
Claude Sonnet 51.0002.000.000400.000
Claude Sonnet 4.x31.0002.000.000400.000
Claude Haiku 4.51.0002.000.000400.000
Claude Haiku 3.5 (desativado, exceto no Bedrock e no Google Cloud)1.000100.000420.000

1 O limite de taxa do Fable é um limite total que se aplica ao tráfego combinado entre Claude Fable 5.1 e Claude Fable 5. Claude Mythos 5.1 e Claude Mythos 5 compartilham um limite combinado separado nos mesmos termos.

2 O limite de taxa do Opus é um limite total que se aplica ao tráfego combinado do Claude Opus 4.8, Opus 4.7, Opus 4.6 e Opus 4.5. O Claude Opus 5.5 e o Claude Opus 5 têm, cada um, um limite de taxa separado e não fazem parte desse bucket combinado.

3 O limite de taxa do Sonnet 4.x é um limite total que se aplica ao tráfego combinado do Sonnet 4.6 e do Sonnet 4.5. O Claude Sonnet 5.5 e o Claude Sonnet 5 têm, cada um, um limite de taxa separado e não fazem parte desse bucket combinado.

4 O limite conta cache_read_input_tokens para o uso de ITPM.

Message Batches API

A Message Batches API tem seu próprio conjunto de limites de taxa, que são compartilhados entre todos os modelos. Eles incluem um limite de requisições por minuto (RPM) para todos os endpoints da API e um limite no número de requisições em lote que podem estar na fila de processamento ao mesmo tempo. Uma "requisição em lote" aqui se refere a uma parte de um Message Batch. Você pode criar um Message Batch contendo milhares de requisições em lote, cada uma das quais conta para esse limite. Uma requisição em lote é considerada parte da fila de processamento quando ainda não foi processada com sucesso pelo modelo.

Máximo de requisições por minuto (RPM)Máximo de requisições em lote na fila de processamentoMáximo de requisições em lote por lote
1.000200.000100.000

Managed Agents

Os endpoints do Claude Managed Agents têm limite de taxa por organização. Esses limites são separados dos limites de taxa da Messages API acima.

OperaçãoLimite
Endpoints de criação (por exemplo, agentes, sessões e ambientes)300 requisições por minuto
Endpoints de leitura (por exemplo, recuperar, listar e fazer streaming)1.200 requisições por minuto

Files API

As requisições da Files API têm seu próprio limite por organização, compartilhado entre as operações de upload, listagem, recuperação, download e exclusão, e separado dos limites da Messages API descritos anteriormente nesta página. Consulte Limites de taxa da Files API para o valor atual.

Limites de taxa do fast mode

Ao usar o fast mode (prévia de pesquisa) com speed: "fast" no Claude Opus 5.5, Claude Opus 5, ou Opus 4.8, aplicam-se limites de taxa dedicados, separados dos limites de taxa padrão do Opus. Quando os limites de taxa do fast mode são excedidos, a API retorna um erro 429 com um cabeçalho retry-after. O fast mode não está disponível no Claude Opus 4.7 (as requisições retornam um erro) nem no Claude Opus 4.6 (requisições para claude-opus-4-6 com speed: "fast" são executadas na velocidade padrão). Consulte Modo rápido.

A resposta inclui cabeçalhos anthropic-fast-* que indicam o status do seu limite de taxa do fast mode. Consulte Limites de taxa do fast mode para detalhes sobre esses cabeçalhos.

Monitorando seus limites de taxa no Console

Você pode monitorar o uso dos seus limites de taxa na página Uso do Claude Console.

Além de fornecer gráficos de tokens e requisições, a página de Uso fornece dois gráficos separados de limite de taxa. Use esses gráficos para ver quanta margem você tem para crescer, identificar quando pode estar atingindo o pico de uso, entender quais limites de taxa solicitar e aprender como melhorar suas taxas de cache. Os gráficos visualizam várias métricas para um determinado limite de taxa (por exemplo, por modelo):

  • O gráfico Rate Limit - Input Tokens inclui:
    • Máximo por hora de tokens de entrada não em cache por minuto
    • Seu limite de taxa atual de tokens de entrada por minuto
    • A taxa de cache dos seus tokens de entrada (ou seja, a porcentagem de tokens de entrada lidos do cache)
  • O gráfico Rate Limit - Output Tokens inclui:
    • Máximo por hora de tokens de saída por minuto
    • Seu limite de taxa atual de tokens de saída por minuto

Solicitando limites mais altos

Para solicitar limites de taxa mais altos ou um teto de gastos mensal mais alto, use Request rate limit increase na página Limites de taxa. O suporte da Anthropic também pode aumentar limites; para necessidades urgentes, entre em contato com o suporte da Anthropic.

Definindo limites mais baixos para Workspaces

Para saber mais sobre workspaces, consulte Workspaces.

Para proteger os Workspaces da sua Organização contra possível uso excessivo, você pode definir limites de gastos e de taxa personalizados por Workspace.

Exemplo: se o limite da sua Organização for de 40.000 tokens de entrada por minuto e 8.000 tokens de saída por minuto, você pode limitar um Workspace a 30.000 tokens de entrada por minuto. Isso protege outros Workspaces contra possível uso excessivo e garante uma distribuição mais equitativa de recursos em toda a sua Organização. Os tokens por minuto restantes não utilizados (ou mais, se esse Workspace não usar o limite) ficam então disponíveis para uso por outros Workspaces.

Observação:

  • Você não pode definir limites no Workspace padrão.
  • Se não forem definidos, os limites do Workspace correspondem ao limite da Organização.
  • Os limites de Workspace são definidos por tipo de limitador (como requisições por minuto, tokens de entrada por minuto ou tokens de saída por minuto).
  • Os limites de toda a Organização sempre se aplicam, mesmo que a soma dos limites dos Workspaces seja maior.

Para ler programaticamente os limites de taxa atuais da sua organização e dos seus workspaces, use a Rate Limits API.

Cabeçalhos de resposta

A resposta da API inclui cabeçalhos que mostram o limite de taxa aplicado, o uso atual e quando o limite será redefinido.

Os seguintes cabeçalhos são retornados:

CabeçalhoDescrição
retry-afterO número de segundos a aguardar até que você possa tentar a requisição novamente. Tentativas anteriores falharão. Não é enviado com o 429 de teto de gastos (consulte Atingindo seu teto de gastos).
anthropic-ratelimit-requests-limitO número máximo de requisições permitidas em qualquer período de limite de taxa.
anthropic-ratelimit-requests-remainingO número de requisições restantes antes de atingir o limite de taxa.
anthropic-ratelimit-requests-resetO momento em que o limite de taxa de requisições será totalmente reabastecido, fornecido no formato RFC 3339.
anthropic-ratelimit-tokens-limitO número máximo de tokens permitidos em qualquer período de limite de taxa.
anthropic-ratelimit-tokens-remainingO número de tokens restantes (arredondado para o milhar mais próximo) antes de atingir o limite de taxa.
anthropic-ratelimit-tokens-resetO momento em que o limite de taxa de tokens será totalmente reabastecido, fornecido no formato RFC 3339.
anthropic-ratelimit-input-tokens-limitO número máximo de tokens de entrada permitidos em qualquer período de limite de taxa.
anthropic-ratelimit-input-tokens-remainingO número de tokens de entrada restantes (arredondado para o milhar mais próximo) antes de atingir o limite de taxa.
anthropic-ratelimit-input-tokens-resetO momento em que o limite de taxa de tokens de entrada será totalmente reabastecido, fornecido no formato RFC 3339.
anthropic-ratelimit-output-tokens-limitO número máximo de tokens de saída permitidos em qualquer período de limite de taxa.
anthropic-ratelimit-output-tokens-remainingO número de tokens de saída restantes (arredondado para o milhar mais próximo) antes de atingir o limite de taxa.
anthropic-ratelimit-output-tokens-resetO momento em que o limite de taxa de tokens de saída será totalmente reabastecido, fornecido no formato RFC 3339.
anthropic-priority-input-tokens-limitO número máximo de tokens de entrada do Priority Tier permitidos em qualquer período de limite de taxa. (Somente Priority Tier)
anthropic-priority-input-tokens-remainingO número de tokens de entrada do Priority Tier restantes (arredondado para o milhar mais próximo) antes de atingir o limite de taxa. (Somente Priority Tier)
anthropic-priority-input-tokens-resetO momento em que o limite de taxa de tokens de entrada do Priority Tier será totalmente reabastecido, fornecido no formato RFC 3339. (Somente Priority Tier)
anthropic-priority-output-tokens-limitO número máximo de tokens de saída do Priority Tier permitidos em qualquer período de limite de taxa. (Somente Priority Tier)
anthropic-priority-output-tokens-remainingO número de tokens de saída do Priority Tier restantes (arredondado para o milhar mais próximo) antes de atingir o limite de taxa. (Somente Priority Tier)
anthropic-priority-output-tokens-resetO momento em que o limite de taxa de tokens de saída do Priority Tier será totalmente reabastecido, fornecido no formato RFC 3339. (Somente Priority Tier)

Os cabeçalhos anthropic-ratelimit-tokens-* exibem os valores do limite mais restritivo atualmente em vigor. Por exemplo, se você excedeu o limite de tokens por minuto do Workspace, os cabeçalhos conterão os valores do limite de taxa de tokens por minuto do Workspace. Se os limites de Workspace não se aplicarem, os cabeçalhos retornarão o total de tokens restantes, onde o total é a soma dos tokens de entrada e de saída. Essa abordagem garante que você tenha visibilidade da restrição mais relevante sobre seu uso atual da API. Para ver em qual Workspace uma requisição foi contabilizada, leia o cabeçalho de resposta anthropic-workspace-id, que contém o ID do Workspace para o qual sua chave de API ou token de acesso foi resolvido.

Was this page helpful?