Modo rápido (vista previa de investigación)
Obtén hasta 2.5 veces más tokens de salida por segundo de los modelos Claude Opus compatibles.
El "fast mode" (modo rápido) ofrece hasta 2.5 veces más tokens de salida por segundo con Claude Opus 5.5, Claude Opus 5, y Claude Opus 4.8, a precios premium. Para activarlo, establece speed: "fast" junto con el encabezado beta fast-mode-2026-02-01 en tu solicitud.
Modelos compatibles
El modo rápido es compatible con los siguientes modelos:
- Claude Opus 5.5 ()
- Claude Opus 5 ()
- Claude Opus 4.8 ()
Cómo funciona el modo rápido
El modo rápido ejecuta el mismo modelo con una configuración de inferencia más rápida. No hay ningún cambio en la inteligencia ni en las capacidades.
- Hasta 2.5 veces más tokens de salida por segundo en comparación con la velocidad estándar
- Los beneficios de velocidad se centran en los "output tokens per second" (tokens de salida por segundo), u OTPS, no en el "time to first token" (tiempo hasta el primer token), o TTFT
- Los mismos pesos y comportamiento del modelo (no es un modelo diferente)
- Compatible con streaming, donde la ganancia en OTPS es más visible
Uso básico
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5-5",
max_tokens=4096,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[
{"role": "user", "content": "Refactor this module to use dependency injection"}
],
)
for block in response.content:
if block.type == "text":
print(block.text)Precios
El modo rápido tiene un precio basado en un multiplicador sobre las tarifas estándar en toda la "context window" (ventana de contexto), incluidas las solicitudes de más de 200k tokens de entrada. La siguiente tabla muestra los precios del modo rápido para los modelos compatibles:
| Modelo | Entrada | Salida |
|---|---|---|
| Claude Opus 5.5 | $8 USD / MTok | $40 USD / MTok |
| Claude Opus 5 / Claude Opus 4.8 | $10 USD / MTok | $50 USD / MTok |
Los precios del modo rápido se acumulan con otros modificadores de precio:
- Los multiplicadores de almacenamiento en caché de prompts se aplican sobre los precios del modo rápido
- Los multiplicadores de residencia de datos se aplican sobre los precios del modo rápido
Para conocer los detalles completos de precios, consulta la página de Precios.
Límites de velocidad
El modo rápido tiene un "rate limit" (límite de velocidad) dedicado que es independiente de los límites de velocidad estándar de Opus. Cuando se excede tu límite de velocidad del modo rápido, la API devuelve un error 429 con un encabezado retry-after que indica cuándo habrá capacidad disponible.
La respuesta incluye encabezados que indican el estado de tu límite de velocidad del modo rápido:
| Encabezado | Descripción |
|---|---|
anthropic-fast-input-tokens-limit | Máximo de tokens de entrada del modo rápido por minuto |
anthropic-fast-input-tokens-remaining | Tokens de entrada del modo rápido restantes |
anthropic-fast-input-tokens-reset | Momento en que se restablece el límite de tokens de entrada del modo rápido |
anthropic-fast-output-tokens-limit | Máximo de tokens de salida del modo rápido por minuto |
anthropic-fast-output-tokens-remaining | Tokens de salida del modo rápido restantes |
anthropic-fast-output-tokens-reset | Momento en que se restablece el límite de tokens de salida del modo rápido |
Para conocer los límites de velocidad específicos de cada nivel, consulta la página de Límites de velocidad.
Verificar qué velocidad se usó
El objeto usage de la respuesta incluye un campo speed que indica qué velocidad se usó, ya sea "fast" o "standard". Solicitar speed: "fast" en un modelo que no admite el modo rápido devuelve un error, al igual que exceder los límites de velocidad o la capacidad del modo rápido (un 429 o 529). Cuando una solicitud con speed: "fast" tiene éxito, usage.speed es "fast". Si usas Claude Opus 4.6 y solicitas el modo rápido, su comportamiento es único. En lugar de devolver un error como otros modelos que no admiten el modo rápido, cambia silenciosamente a la velocidad estándar. Aunque no hay error con Opus 4.6, el campo speed muestra correctamente "standard".
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5-5",
max_tokens=1024,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[{"role": "user", "content": "Hello"}],
)
print(response.usage.speed) # "fast" or "standard"{
"id": "msg_01XFDUDYJgAACzvnptvVoYEL",
"type": "message",
"role": "assistant",
"usage": {
"input_tokens": 8,
"output_tokens": 12,
"speed": "fast"
}
}Para hacer seguimiento del uso y los costos del modo rápido en toda tu organización, consulta la API de uso y costos.
Reintentos y alternativa de respaldo
Reintentos automáticos
Cuando se superan los límites de velocidad del modo rápido, la API devuelve un error 429 con un encabezado retry-after. Los SDK de Anthropic reintentan automáticamente estas solicitudes hasta 2 veces de forma predeterminada (configurable con max_retries), esperando el retraso especificado por el servidor antes de cada reintento. Como el modo rápido usa una reposición continua de tokens, el retraso de retry-after suele ser corto y las solicitudes tienen éxito en cuanto hay capacidad disponible.
Recurrir a la velocidad estándar
Si prefieres recurrir a la velocidad estándar en lugar de esperar a que haya capacidad en el modo rápido, captura el error de límite de velocidad y reintenta sin speed: "fast". Establece max_retries en 0 en la solicitud rápida inicial para omitir los reintentos automáticos y fallar de inmediato ante errores de límite de velocidad.
Como establecer max_retries en 0 también desactiva los reintentos para otros errores transitorios (sobrecarga, errores internos del servidor), los siguientes ejemplos vuelven a emitir la solicitud original con los reintentos predeterminados para esos casos.
client = anthropic.Anthropic()
def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
try:
return client.with_options(max_retries=max_retries).beta.messages.create(
**params
)
except anthropic.RateLimitError:
if params.get("speed") == "fast":
del params["speed"]
return create_message_with_fast_fallback(max_retries=max_retries, **params)
raise
except (
anthropic.APIStatusError,
anthropic.APIConnectionError,
) as error:
if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
raise
if max_attempts > 1:
return create_message_with_fast_fallback(
max_retries=max_retries, max_attempts=max_attempts - 1, **params
)
raise
message = create_message_with_fast_fallback(
model="claude-opus-5-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello"}],
betas=["fast-mode-2026-02-01"],
speed="fast",
max_retries=0,
)Consideraciones
- Almacenamiento en caché de prompts: Cambiar entre la velocidad rápida y la estándar invalida la caché de prompts. Las solicitudes a diferentes velocidades no comparten prefijos almacenados en caché.
- Modelos compatibles: El modo rápido es compatible con Claude Opus 5.5, Claude Opus 5, y Claude Opus 4.8. Consulta Modelos compatibles.
- TTFT: Los beneficios del modo rápido se centran en los tokens de salida por segundo (OTPS), no en el tiempo hasta el primer token (TTFT).
- Batch API: El modo rápido no está disponible con la Batch API.
- Priority Tier: El modo rápido no está disponible con un compromiso de Priority Tier.
- Claude Platform on AWS: Actualmente, el modo rápido no está disponible en Claude Platform on AWS.
Próximos pasos
Obtén resultados JSON validados de flujos de trabajo de agentes.
Conoce la estructura de precios de Anthropic para modelos y funcionalidades.
Controla cuántos tokens usa Claude al responder con el parámetro effort, equilibrando entre la exhaustividad de la respuesta y la eficiencia de tokens.
Transmite las respuestas de la Messages API de forma incremental con eventos enviados por el servidor, incluyendo texto, uso de herramientas y deltas de pensamiento extendido.
Was this page helpful?