Existem dois tipos de limites:
A API aplica limites configurados pelo serviço no nível da organização, mas você também pode definir limites configuráveis pelo usuário para os workspaces da sua organização.
Cada um dos níveis Start, Build e Scale possui um teto de gastos mensal, que é o máximo que sua organização pode gastar na API a cada mês calendário. Quando você atinge o teto de gastos do seu nível, o uso da API é pausado até o próximo mês, a menos que você solicite um limite mais alto. Você pode visualizar o teto de gastos mensal da sua organização e definir seu próprio limite na página Billing.
| Nível de uso | Teto de gastos mensal |
|---|---|
| Start | $500 USD |
| Build | $1.000 USD |
| Scale | $200.000 USD |
Organizações no nível Custom não têm teto de gastos mensal; os limites são acordados com a equipe de conta.
Você também pode definir seu próprio limite de gastos abaixo do teto do seu nível para controlar custos:
Navegue até a página Billing
Vá para Settings > Billing no Claude Console.
Abra o editor de limite de gastos
Na seção Spend limits, clique em Adjust limit (ou Set limit se nenhum limite estiver definido no momento).
Ajuste seu limite de gastos
Insira um novo valor. Seu limite de gastos não pode exceder o teto do seu nível atual.
Os limites de taxa para a Messages API são medidos em requisições por minuto (RPM), tokens de entrada por minuto (ITPM) e tokens de saída por minuto (OTPM) para cada classe de modelo.
Se você exceder qualquer um dos limites de taxa, receberá um erro 429 descrevendo qual limite de taxa foi excedido, junto com um cabeçalho retry-after indicando quanto tempo esperar.
Muitos provedores de API usam um limite combinado de "tokens por minuto" (TPM) que pode incluir todos os tokens, tanto em cache quanto não em cache, de entrada e de saída. Para a maioria dos modelos Claude, apenas tokens de entrada não armazenados em cache contam para seus limites de taxa de ITPM. Esta é uma vantagem importante que torna os limites de taxa efetivamente mais altos do que podem parecer inicialmente.
Os limites de taxa de ITPM são estimados no início de cada requisição, e a estimativa é ajustada durante a requisição para refletir o número real de tokens de entrada usados.
Veja o que conta para o ITPM:
input_tokens (tokens após o último ponto de interrupção de cache) ✓ Contam para o ITPMcache_creation_input_tokens (tokens sendo gravados no cache) ✓ Contam para o ITPMcache_read_input_tokens (tokens lidos do cache) ✗ NÃO contam para o ITPM na maioria dos modelosExemplo: Com um limite de 2.000.000 ITPM e uma taxa de acerto de cache de 80%, você poderia efetivamente processar 10.000.000 de tokens de entrada totais por minuto (2M não em cache + 8M em cache), porque tokens em cache não contam para seu limite de taxa.
Os limites de taxa de OTPM são avaliados em tempo real conforme os tokens de saída são produzidos, contando apenas os tokens realmente gerados. O parâmetro max_tokens não entra nos cálculos de limite de taxa de OTPM, portanto não há desvantagem de limite de taxa em definir um valor mais alto de max_tokens.
Os limites de taxa são aplicados separadamente para cada modelo; portanto, você pode usar diferentes modelos até seus respectivos limites simultaneamente. Você pode verificar seus limites de taxa atuais e comportamento na página Rate limits no Claude Console, ou ler os limites configurados programaticamente com a Rate Limits API.
| Modelo | Máximo de requisições por minuto (RPM) | Máximo de tokens de entrada por minuto (ITPM) | Máximo de tokens de saída por minuto (OTPM) |
|---|---|---|---|
| Claude Fable 5 | 1.000 | 500.000 | 100.000 |
| Claude Opus 5 | 1.000 | 2.000.000 | 400.000 |
| Claude Opus 4.x* | 1.000 | 2.000.000 | 400.000 |
| Claude Sonnet 5 | 1.000 | 2.000.000 | 400.000 |
| Claude Sonnet 4.x** | 1.000 | 2.000.000 | 400.000 |
| Claude Haiku 4.5 | 1.000 | 2.000.000 | 400.000 |
| Claude Haiku 3.5 (desativado, exceto no Bedrock e Google Cloud) | 1.000 | 100.000† | 20.000 |
* O limite de taxa do Opus é um limite total que se aplica ao tráfego combinado entre Claude Opus 4.8, Opus 4.7, Opus 4.6 e Opus 4.5. O Claude Opus 5 tem um limite de taxa separado e não faz parte deste bucket combinado.
** O limite de taxa do Sonnet 4.x é um limite total que se aplica ao tráfego combinado entre Sonnet 4.6 e Sonnet 4.5. O Claude Sonnet 5 tem um limite de taxa separado e não faz parte deste bucket combinado.
† O limite conta cache_read_input_tokens para o uso de ITPM.
A Message Batches API tem seu próprio conjunto de limites de taxa que são compartilhados entre todos os modelos. Isso inclui um limite de requisições por minuto (RPM) para todos os endpoints da API e um limite no número de requisições de lote que podem estar na fila de processamento ao mesmo tempo. Uma "requisição de lote" aqui se refere a parte de um Message Batch. Você pode criar um Message Batch contendo milhares de requisições de lote, cada uma das quais conta para esse limite. Uma requisição de lote é considerada parte da fila de processamento quando ainda não foi processada com sucesso pelo modelo.
| Máximo de requisições por minuto (RPM) | Máximo de requisições de lote na fila de processamento | Máximo de requisições de lote por lote |
|---|---|---|
| 1.000 | 200.000 | 100.000 |
Os endpoints do Claude Managed Agents têm limite de taxa por organização. Esses limites são separados dos limites de taxa da Messages API acima.
| Operação | Limite |
|---|---|
| Endpoints de criação (por exemplo, agents, sessions e environments) | 300 requisições por minuto |
| Endpoints de leitura (por exemplo, retrieve, list e stream) | 1.200 requisições por minuto |
Ao usar o fast mode (prévia de pesquisa) com speed: "fast" no Claude Opus 5 ou Opus 4.8, aplicam-se limites de taxa dedicados que são separados dos limites de taxa padrão do Opus. Quando os limites de taxa do fast mode são excedidos, a API retorna um erro 429 com um cabeçalho retry-after. O fast mode não está disponível no Claude Opus 4.7 (as requisições retornam um erro) ou no Claude Opus 4.6 (requisições para claude-opus-4-6 com speed: "fast" são executadas na velocidade padrão). Consulte Fast mode.
A resposta inclui cabeçalhos anthropic-fast-* que indicam o status do seu limite de taxa do fast mode. Consulte Limites de taxa do fast mode para detalhes sobre esses cabeçalhos.
Você pode monitorar seu uso de limite de taxa na página Usage do Claude Console.
Além de fornecer gráficos de tokens e requisições, a página Usage fornece dois gráficos separados de limite de taxa. Use esses gráficos para ver quanta margem você tem para crescer, identificar quando pode estar atingindo o pico de uso, entender quais limites de taxa solicitar e aprender como melhorar suas taxas de cache. Os gráficos visualizam várias métricas para um determinado limite de taxa (por exemplo, por modelo):
Para solicitar limites de taxa mais altos ou um teto de gastos mensal mais alto, use Request rate limit increase na página Rate limits.
Para mais informações sobre workspaces, consulte Workspaces.
Para proteger Workspaces na sua Organização contra possível uso excessivo, você pode definir limites personalizados de gastos e de taxa por Workspace.
Exemplo: Se o limite da sua Organização é de 40.000 tokens de entrada por minuto e 8.000 tokens de saída por minuto, você pode limitar um Workspace a 30.000 tokens de entrada por minuto. Isso protege outros Workspaces contra possível uso excessivo e garante uma distribuição mais equitativa de recursos em toda a sua Organização. Os tokens por minuto restantes não utilizados (ou mais, se esse Workspace não usar o limite) ficam então disponíveis para outros Workspaces usarem.
Observação:
Para ler seus limites de taxa atuais de organização e workspace programaticamente, use a Rate Limits API.
A resposta da API inclui cabeçalhos que mostram o limite de taxa aplicado, o uso atual e quando o limite será redefinido.
Os seguintes cabeçalhos são retornados:
| Cabeçalho | Descrição |
|---|---|
retry-after | O número de segundos a esperar até que você possa tentar a requisição novamente. Tentativas anteriores falharão. |
anthropic-ratelimit-requests-limit | O número máximo de requisições permitidas dentro de qualquer período de limite de taxa. |
anthropic-ratelimit-requests-remaining | O número de requisições restantes antes de ser limitado por taxa. |
anthropic-ratelimit-requests-reset | O momento em que o limite de taxa de requisições será totalmente reabastecido, fornecido no formato RFC 3339. |
anthropic-ratelimit-tokens-limit | O número máximo de tokens permitidos dentro de qualquer período de limite de taxa. |
anthropic-ratelimit-tokens-remaining | O número de tokens restantes (arredondado para o milhar mais próximo) antes de ser limitado por taxa. |
anthropic-ratelimit-tokens-reset | O momento em que o limite de taxa de tokens será totalmente reabastecido, fornecido no formato RFC 3339. |
anthropic-ratelimit-input-tokens-limit | O número máximo de tokens de entrada permitidos dentro de qualquer período de limite de taxa. |
anthropic-ratelimit-input-tokens-remaining | O número de tokens de entrada restantes (arredondado para o milhar mais próximo) antes de ser limitado por taxa. |
anthropic-ratelimit-input-tokens-reset | O momento em que o limite de taxa de tokens de entrada será totalmente reabastecido, fornecido no formato RFC 3339. |
anthropic-ratelimit-output-tokens-limit | O número máximo de tokens de saída permitidos dentro de qualquer período de limite de taxa. |
anthropic-ratelimit-output-tokens-remaining | O número de tokens de saída restantes (arredondado para o milhar mais próximo) antes de ser limitado por taxa. |
anthropic-ratelimit-output-tokens-reset | O momento em que o limite de taxa de tokens de saída será totalmente reabastecido, fornecido no formato RFC 3339. |
anthropic-priority-input-tokens-limit | O número máximo de tokens de entrada do Priority Tier permitidos dentro de qualquer período de limite de taxa. (Somente Priority Tier) |
anthropic-priority-input-tokens-remaining | O número de tokens de entrada do Priority Tier restantes (arredondado para o milhar mais próximo) antes de ser limitado por taxa. (Somente Priority Tier) |
anthropic-priority-input-tokens-reset | O momento em que o limite de taxa de tokens de entrada do Priority Tier será totalmente reabastecido, fornecido no formato RFC 3339. (Somente Priority Tier) |
anthropic-priority-output-tokens-limit | O número máximo de tokens de saída do Priority Tier permitidos dentro de qualquer período de limite de taxa. (Somente Priority Tier) |
anthropic-priority-output-tokens-remaining | O número de tokens de saída do Priority Tier restantes (arredondado para o milhar mais próximo) antes de ser limitado por taxa. (Somente Priority Tier) |
anthropic-priority-output-tokens-reset | O momento em que o limite de taxa de tokens de saída do Priority Tier será totalmente reabastecido, fornecido no formato RFC 3339. (Somente Priority Tier) |
Os cabeçalhos anthropic-ratelimit-tokens-* exibem os valores para o limite mais restritivo atualmente em vigor. Por exemplo, se você excedeu o limite de tokens por minuto do Workspace, os cabeçalhos conterão os valores de limite de taxa de tokens por minuto do Workspace. Se os limites de Workspace não se aplicarem, os cabeçalhos retornarão o total de tokens restantes, onde o total é a soma de tokens de entrada e saída. Essa abordagem garante que você tenha visibilidade sobre a restrição mais relevante no seu uso atual da API.
Was this page helpful?