Claude Platform Docs
Referencia de la APISoporte y configuración

Límites de velocidad

Para mitigar el uso indebido y gestionar la capacidad de la API, existen límites sobre cuánto puede usar una organización la Claude API.

Existen dos tipos de límites:

  1. Los límites de gasto establecen un costo mensual máximo en el que una organización puede incurrir por el uso de la API.
  2. Los "rate limits" (límites de velocidad) establecen el número máximo de solicitudes a la API que una organización puede realizar durante un período de tiempo definido.

La API aplica límites configurados por el servicio a nivel de organización, pero también puedes establecer límites configurables por el usuario para los espacios de trabajo de tu organización.

Acerca de los límites de velocidad

  • Los límites están diseñados para prevenir el abuso de la API, minimizando al mismo tiempo el impacto en los patrones de uso comunes de los clientes.
  • Los límites se definen por nivel de uso. Las organizaciones se ubican en un nivel automáticamente según su historial de uso y el estado de su cuenta, y pueden pasar a un nivel superior con el tiempo a medida que usan la API.
  • Las organizaciones nuevas y las organizaciones con un historial de uso limitado pueden comenzar en el nivel Evaluation, con límites inferiores a los límites estándar que se muestran en esta página mientras se establece el historial de la cuenta. Estos límites iniciales forman parte de cómo Anthropic previene el fraude y el abuso, y aumentan automáticamente a medida que tu organización acumula historial de uso.
  • Los límites se establecen a nivel de organización. Puedes ver el nivel de tu organización y sus límites actuales en la página Límites de velocidad de la Claude Console.
  • Es posible que alcances los límites de velocidad en intervalos de tiempo más cortos. Por ejemplo, una tasa de 60 solicitudes por minuto (RPM) podría aplicarse como 1 solicitud por segundo. Las ráfagas cortas de solicitudes pueden exceder el límite y provocar errores de límite de velocidad.
  • Los siguientes límites son los límites estándar para cada nivel. Si necesitas límites más altos, consulta Solicitar límites más altos.
  • La API utiliza el algoritmo de token bucket para aplicar los límites de velocidad. Esto significa que tu capacidad se repone continuamente hasta tu límite máximo, en lugar de restablecerse en intervalos fijos.
  • Todos los límites descritos aquí representan el uso máximo permitido, no mínimos garantizados. Estos límites tienen como objetivo reducir el gasto excesivo no intencional y garantizar una distribución justa de los recursos entre los usuarios.

Límites de gasto

Cada uno de los niveles Start, Build y Scale tiene un tope de gasto mensual, que es el máximo que tu organización puede gastar en la API cada mes calendario. Puedes ver el tope de gasto mensual de tu organización y establecer tu propio límite en la página Facturación.

Nivel de usoTope de gasto mensual
Start$500 USD
Build$1,000 USD
Scale$200,000 USD

Las organizaciones en el nivel Custom no tienen tope de gasto mensual; los límites se acuerdan con su equipo de cuenta.

Alcanzar tu tope de gasto

Una vez que alcanzas el tope de gasto de tu nivel, el uso de la API se pausa hasta las 00:00 UTC del primer día del mes siguiente, a menos que solicites un límite más alto antes. Mientras el uso está pausado, las solicitudes a la API devuelven HTTP 429:

{
  "type": "error",
  "error": {
    "type": "rate_limit_error",
    "message": "You have reached your API usage limits: your organization has crossed its monthly API usage threshold, set based on your organization's API tier. You will regain access on 2026-09-01 at 00:00 UTC.",
    "details": { "error_code": "enforced_spend_limit_reached" }
  },
  "request_id": "req_018EeWyXxfu5pfWkrYcMdjWG"
}
  • El tipo de error es rate_limit_error, el mismo que para un límite de velocidad, pero la respuesta no tiene encabezado retry-after. Reintentar, incluidos los reintentos automáticos de los SDK, falla hasta que se reanude el acceso.
  • En la Messages API, error.details.error_code es enforced_spend_limit_reached. Úsalo para distinguir esta respuesta de un límite de velocidad.
  • Pasar a un nivel superior restaura el acceso; consulta Solicitar límites más altos.

Establecer tu propio límite de gasto

También puedes establecer tu propio límite de gasto por debajo del tope de tu nivel para controlar los costos:

  1. Navega a la página de Facturación

    Ve a Settings > Billing en la Claude Console.

  2. Abre el editor de límite de gasto

    En la sección Spend limits, haz clic en Adjust limit (o Set limit si actualmente no hay ningún límite establecido).

  3. Ajusta tu límite de gasto

    Ingresa un nuevo valor. Tu límite de gasto no puede exceder el tope de tu nivel actual.

Cuando el uso alcanza un límite de gasto que estableciste, las solicitudes devuelven HTTP 400 con el tipo de error invalid_request_error. El mensaje comienza con You have reached your specified API usage limits, o You have reached your specified workspace API usage limits para un límite de espacio de trabajo, e indica cuándo se reanuda el acceso. Aumenta o elimina el límite para restaurar el acceso antes.

Los límites del espacio de trabajo de Claude Code se verifican por separado: las solicitudes de Claude Code que superen el límite de ese espacio de trabajo pueden recibir en su lugar un 429 que incluye un encabezado retry-after.

Límites de velocidad

Los límites de velocidad para la Messages API se miden en solicitudes por minuto (RPM), tokens de entrada por minuto (ITPM) y tokens de salida por minuto (OTPM) para cada clase de modelo. Si excedes cualquiera de los límites de velocidad, recibirás un error 429 que describe qué límite de velocidad se excedió, junto con un encabezado retry-after que indica cuánto tiempo esperar.

ITPM con reconocimiento de caché

Muchos proveedores de API utilizan un límite combinado de "tokens por minuto" (TPM) que puede incluir todos los tokens, tanto en caché como sin caché, de entrada y de salida. Para la mayoría de los modelos Claude, solo los tokens de entrada sin caché cuentan para tus límites de velocidad de ITPM. Esta es una ventaja clave que hace que los límites de velocidad sean efectivamente más altos de lo que podrían parecer inicialmente.

Los límites de velocidad de ITPM se estiman al comienzo de cada solicitud, y la estimación se ajusta durante la solicitud para reflejar el número real de tokens de entrada utilizados.

Esto es lo que cuenta para el ITPM:

  • input_tokens (tokens después del último punto de interrupción de caché) ✓ Cuentan para el ITPM
  • cache_creation_input_tokens (tokens que se están escribiendo en la caché) ✓ Cuentan para el ITPM
  • cache_read_input_tokens (tokens leídos desde la caché) ✗ NO cuentan para el ITPM en la mayoría de los modelos

Ejemplo: Con un límite de 2,000,000 ITPM y una tasa de aciertos de caché del 80%, podrías procesar efectivamente 10,000,000 tokens de entrada totales por minuto (2M sin caché + 8M en caché), porque los tokens en caché no cuentan para tu límite de velocidad.

Para aprovechar al máximo tus límites de velocidad, almacena en caché el contenido repetido, como instrucciones del sistema y prompts, documentos de contexto extensos, definiciones de herramientas e historial de conversación; consulta almacenamiento en caché de prompts para obtener orientación. Con un almacenamiento en caché eficaz, puedes aumentar sustancialmente tu rendimiento real sin elevar tus límites de velocidad. Monitorea tu tasa de aciertos de caché en la página de Uso para ajustar tu estrategia de almacenamiento en caché.

Los límites de velocidad de OTPM se evalúan en tiempo real a medida que se producen los tokens de salida, contando solo los tokens realmente generados. El parámetro max_tokens no influye en los cálculos del límite de velocidad de OTPM, por lo que no hay ninguna desventaja en cuanto a límites de velocidad al establecer un valor de max_tokens más alto.

Los límites de velocidad se aplican por separado para cada modelo; por lo tanto, puedes usar diferentes modelos hasta sus respectivos límites simultáneamente. Puedes consultar tus límites de velocidad actuales y su comportamiento en la página Límites de velocidad de la Claude Console, o leer los límites configurados de forma programática con la Rate Limits API.

ModeloMáximo de solicitudes por minuto (RPM)Máximo de tokens de entrada por minuto (ITPM)Máximo de tokens de salida por minuto (OTPM)
Claude Fable 5.x11,000500,000100,000
Claude Opus 5.51,0002,000,000400,000
Claude Opus 51,0002,000,000400,000
Claude Opus 4.x21,0002,000,000400,000
Claude Sonnet 5.51,0002,000,000400,000
Claude Sonnet 51,0002,000,000400,000
Claude Sonnet 4.x31,0002,000,000400,000
Claude Haiku 4.51,0002,000,000400,000
Claude Haiku 3.5 (retirado, excepto en Bedrock y Google Cloud)1,000100,000420,000

1 El límite de velocidad de Fable es un límite total que se aplica al tráfico combinado de Claude Fable 5.1 y Claude Fable 5. Claude Mythos 5.1 y Claude Mythos 5 comparten un límite combinado separado en los mismos términos.

2 El límite de velocidad de Opus es un límite total que se aplica al tráfico combinado de Claude Opus 4.8, Opus 4.7, Opus 4.6 y Opus 4.5. Claude Opus 5.5 y Claude Opus 5 tienen cada uno un límite de velocidad independiente y no forman parte de este grupo combinado.

3 El límite de velocidad de Sonnet 4.x es un límite total que se aplica al tráfico combinado de Sonnet 4.6 y Sonnet 4.5. Claude Sonnet 5.5 y Claude Sonnet 5 tienen cada uno un límite de velocidad independiente y no forman parte de este grupo combinado.

4 El límite cuenta cache_read_input_tokens para el uso de ITPM.

Message Batches API

La Message Batches API tiene su propio conjunto de límites de velocidad, que se comparten entre todos los modelos. Estos incluyen un límite de solicitudes por minuto (RPM) para todos los endpoints de la API y un límite en el número de solicitudes de lote que pueden estar en la cola de procesamiento al mismo tiempo. Una "solicitud de lote" aquí se refiere a una parte de un Message Batch. Puedes crear un Message Batch que contenga miles de solicitudes de lote, cada una de las cuales cuenta para este límite. Una solicitud de lote se considera parte de la cola de procesamiento cuando aún no ha sido procesada exitosamente por el modelo.

Máximo de solicitudes por minuto (RPM)Máximo de solicitudes de lote en la cola de procesamientoMáximo de solicitudes de lote por lote
1,000200,000100,000

Managed Agents

Los endpoints de Claude Managed Agents tienen límites de velocidad por organización. Estos límites son independientes de los límites de velocidad de la Messages API anteriores.

OperaciónLímite
Endpoints de creación (por ejemplo, agentes, sesiones y entornos)300 solicitudes por minuto
Endpoints de lectura (por ejemplo, recuperar, listar y hacer streaming)1,200 solicitudes por minuto

Files API

Las solicitudes a la Files API tienen su propio límite por organización, compartido entre las operaciones de carga, listado, recuperación, descarga y eliminación, e independiente de los límites de la Messages API descritos anteriormente en esta página. Consulta Límites de velocidad de la Files API para conocer el valor actual.

Límites de velocidad del modo rápido

Cuando usas el modo rápido (vista previa de investigación) con speed: "fast" en Claude Opus 5.5, Claude Opus 5, u Opus 4.8, se aplican límites de velocidad dedicados que son independientes de los límites de velocidad estándar de Opus. Cuando se superan los límites de velocidad del modo rápido, la API devuelve un error 429 con un encabezado retry-after. El modo rápido no está disponible en Claude Opus 4.7 (las solicitudes devuelven un error) ni en Claude Opus 4.6 (las solicitudes a claude-opus-4-6 con speed: "fast" se ejecutan a velocidad estándar). Consulta Modo rápido.

La respuesta incluye encabezados anthropic-fast-* que indican el estado de tu límite de velocidad del modo rápido. Consulta Límites de velocidad del modo rápido para obtener detalles sobre estos encabezados.

Monitorear tus límites de velocidad en la Console

Puedes monitorear el uso de tus límites de velocidad en la página Uso de la Claude Console.

Además de proporcionar gráficos de tokens y solicitudes, la página de Uso ofrece dos gráficos de límites de velocidad separados. Usa estos gráficos para ver qué margen tienes para crecer, identificar cuándo podrías estar alcanzando el uso máximo, entender qué límites de velocidad solicitar y aprender cómo mejorar tus tasas de almacenamiento en caché. Los gráficos visualizan varias métricas para un límite de velocidad determinado (por ejemplo, por modelo):

  • El gráfico Rate Limit - Input Tokens (Límite de velocidad - Tokens de entrada) incluye:
    • Máximo por hora de tokens de entrada sin caché por minuto
    • Tu límite de velocidad actual de tokens de entrada por minuto
    • La tasa de caché de tus tokens de entrada (es decir, el porcentaje de tokens de entrada leídos desde la caché)
  • El gráfico Rate Limit - Output Tokens (Límite de velocidad - Tokens de salida) incluye:
    • Máximo por hora de tokens de salida por minuto
    • Tu límite de velocidad actual de tokens de salida por minuto

Solicitar límites más altos

Para solicitar límites de velocidad más altos o un tope de gasto mensual más alto, usa Request rate limit increase en la página Límites de velocidad. El soporte de Anthropic también puede aumentar los límites; para necesidades urgentes, contacta al soporte de Anthropic.

Establecer límites más bajos para los espacios de trabajo

Para más información sobre los espacios de trabajo, consulta Espacios de trabajo.

Para proteger los espacios de trabajo de tu organización de un posible uso excesivo, puedes establecer límites de gasto y de velocidad personalizados por espacio de trabajo.

Ejemplo: Si el límite de tu organización es de 40,000 tokens de entrada por minuto y 8,000 tokens de salida por minuto, podrías limitar un espacio de trabajo a 30,000 tokens de entrada por minuto. Esto protege a los demás espacios de trabajo de un posible uso excesivo y garantiza una distribución más equitativa de los recursos en toda tu organización. Los tokens por minuto restantes no utilizados (o más, si ese espacio de trabajo no usa el límite) quedan entonces disponibles para que los usen otros espacios de trabajo.

Nota:

  • No puedes establecer límites en el espacio de trabajo predeterminado.
  • Si no se establecen, los límites del espacio de trabajo coinciden con el límite de la organización.
  • Los límites del espacio de trabajo se establecen por tipo de limitador (como solicitudes por minuto, tokens de entrada por minuto o tokens de salida por minuto).
  • Los límites de toda la organización siempre se aplican, incluso si los límites de los espacios de trabajo suman más.

Para leer de forma programática los límites de velocidad actuales de tu organización y de tus espacios de trabajo, usa la Rate Limits API.

Encabezados de respuesta

La respuesta de la API incluye encabezados que te muestran el límite de velocidad aplicado, el uso actual y cuándo se restablecerá el límite.

Se devuelven los siguientes encabezados:

EncabezadoDescripción
retry-afterEl número de segundos que debes esperar hasta poder reintentar la solicitud. Los reintentos anteriores fallarán. No se envía con el 429 del tope de gasto (consulta Alcanzar tu tope de gasto).
anthropic-ratelimit-requests-limitEl número máximo de solicitudes permitidas dentro de cualquier período de límite de velocidad.
anthropic-ratelimit-requests-remainingEl número de solicitudes restantes antes de que se aplique el límite de velocidad.
anthropic-ratelimit-requests-resetEl momento en que el límite de velocidad de solicitudes se repondrá por completo, proporcionado en formato RFC 3339.
anthropic-ratelimit-tokens-limitEl número máximo de tokens permitidos dentro de cualquier período de límite de velocidad.
anthropic-ratelimit-tokens-remainingEl número de tokens restantes (redondeado al millar más cercano) antes de que se aplique el límite de velocidad.
anthropic-ratelimit-tokens-resetEl momento en que el límite de velocidad de tokens se repondrá por completo, proporcionado en formato RFC 3339.
anthropic-ratelimit-input-tokens-limitEl número máximo de tokens de entrada permitidos dentro de cualquier período de límite de velocidad.
anthropic-ratelimit-input-tokens-remainingEl número de tokens de entrada restantes (redondeado al millar más cercano) antes de que se aplique el límite de velocidad.
anthropic-ratelimit-input-tokens-resetEl momento en que el límite de velocidad de tokens de entrada se repondrá por completo, proporcionado en formato RFC 3339.
anthropic-ratelimit-output-tokens-limitEl número máximo de tokens de salida permitidos dentro de cualquier período de límite de velocidad.
anthropic-ratelimit-output-tokens-remainingEl número de tokens de salida restantes (redondeado al millar más cercano) antes de que se aplique el límite de velocidad.
anthropic-ratelimit-output-tokens-resetEl momento en que el límite de velocidad de tokens de salida se repondrá por completo, proporcionado en formato RFC 3339.
anthropic-priority-input-tokens-limitEl número máximo de tokens de entrada de Priority Tier permitidos dentro de cualquier período de límite de velocidad. (Solo Priority Tier)
anthropic-priority-input-tokens-remainingEl número de tokens de entrada de Priority Tier restantes (redondeado al millar más cercano) antes de que se aplique el límite de velocidad. (Solo Priority Tier)
anthropic-priority-input-tokens-resetEl momento en que el límite de velocidad de tokens de entrada de Priority Tier se repondrá por completo, proporcionado en formato RFC 3339. (Solo Priority Tier)
anthropic-priority-output-tokens-limitEl número máximo de tokens de salida de Priority Tier permitidos dentro de cualquier período de límite de velocidad. (Solo Priority Tier)
anthropic-priority-output-tokens-remainingEl número de tokens de salida de Priority Tier restantes (redondeado al millar más cercano) antes de que se aplique el límite de velocidad. (Solo Priority Tier)
anthropic-priority-output-tokens-resetEl momento en que el límite de velocidad de tokens de salida de Priority Tier se repondrá por completo, proporcionado en formato RFC 3339. (Solo Priority Tier)

Los encabezados anthropic-ratelimit-tokens-* muestran los valores del límite más restrictivo actualmente en vigor. Por ejemplo, si has excedido el límite de tokens por minuto del espacio de trabajo, los encabezados contendrán los valores del límite de velocidad de tokens por minuto del espacio de trabajo. Si no se aplican límites de espacio de trabajo, los encabezados devolverán el total de tokens restantes, donde el total es la suma de los tokens de entrada y de salida. Este enfoque garantiza que tengas visibilidad de la restricción más relevante sobre tu uso actual de la API. Para ver contra qué espacio de trabajo se contabilizó una solicitud, lee el encabezado de respuesta anthropic-workspace-id, que contiene el ID del espacio de trabajo al que se resolvió tu clave de API o token de acceso.

Was this page helpful?