Modo rápido (prévia de pesquisa)
Obtenha até 2,5x mais tokens de saída por segundo dos modelos Claude Opus compatíveis.
O "fast mode" (modo rápido) oferece até 2,5x mais tokens de saída por segundo com Claude Opus 5.5, Claude Opus 5, e Claude Opus 4.8, com preço premium. Para ativá-lo, defina speed: "fast" com o cabeçalho beta fast-mode-2026-02-01 na sua requisição.
Modelos compatíveis
O modo rápido é compatível com os seguintes modelos:
- Claude Opus 5.5 ()
- Claude Opus 5 ()
- Claude Opus 4.8 ()
Como o modo rápido funciona
O modo rápido executa o mesmo modelo com uma configuração de inferência mais rápida. Não há mudança na inteligência ou nas capacidades.
- Até 2,5x mais tokens de saída por segundo em comparação com a velocidade padrão
- Os benefícios de velocidade concentram-se em "output tokens per second" (tokens de saída por segundo), ou OTPS, e não em "time to first token" (tempo até o primeiro token), ou TTFT
- Mesmos pesos e comportamento do modelo (não é um modelo diferente)
- Compatível com streaming, onde o ganho de OTPS é mais visível
Uso básico
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5-5",
max_tokens=4096,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[
{"role": "user", "content": "Refactor this module to use dependency injection"}
],
)
for block in response.content:
if block.type == "text":
print(block.text)Preços
O modo rápido é cobrado com um multiplicador sobre as tarifas padrão em toda a janela de contexto, incluindo requisições com mais de 200 mil tokens de entrada. A tabela a seguir mostra os preços do modo rápido para os modelos compatíveis:
| Modelo | Entrada | Saída |
|---|---|---|
| Claude Opus 5.5 | $8 USD / MTok | $40 USD / MTok |
| Claude Opus 5 / Claude Opus 4.8 | $10 USD / MTok | $50 USD / MTok |
Os preços do modo rápido se acumulam com outros modificadores de preço:
- Multiplicadores de cache de prompt aplicam-se sobre os preços do modo rápido
- Multiplicadores de residência de dados aplicam-se sobre os preços do modo rápido
Para detalhes completos de preços, consulte a página de Preços.
Limites de taxa
O modo rápido tem um "rate limit" (limite de taxa) dedicado, separado dos limites de taxa padrão do Opus. Quando seu limite de taxa do modo rápido é excedido, a API retorna um erro 429 com um cabeçalho retry-after indicando quando haverá capacidade disponível.
A resposta inclui cabeçalhos que indicam o status do seu limite de taxa do modo rápido:
| Cabeçalho | Descrição |
|---|---|
anthropic-fast-input-tokens-limit | Máximo de tokens de entrada do modo rápido por minuto |
anthropic-fast-input-tokens-remaining | Tokens de entrada do modo rápido restantes |
anthropic-fast-input-tokens-reset | Horário em que o limite de tokens de entrada do modo rápido é redefinido |
anthropic-fast-output-tokens-limit | Máximo de tokens de saída do modo rápido por minuto |
anthropic-fast-output-tokens-remaining | Tokens de saída do modo rápido restantes |
anthropic-fast-output-tokens-reset | Horário em que o limite de tokens de saída do modo rápido é redefinido |
Para limites de taxa específicos por nível, consulte a página de Limites de taxa.
Verificando qual velocidade foi usada
O objeto usage da resposta inclui um campo speed que indica qual velocidade foi usada, "fast" ou "standard". Solicitar speed: "fast" em um modelo que não é compatível com o modo rápido retorna um erro, assim como exceder os limites de taxa ou a capacidade do modo rápido (um 429 ou 529). Quando uma requisição com speed: "fast" é bem-sucedida, usage.speed é "fast". Se você estiver usando o Claude Opus 4.6 e solicitar o modo rápido, o comportamento dele é único. Em vez de retornar um erro como outros modelos que não são compatíveis com o modo rápido, ele muda silenciosamente para a velocidade padrão. Embora não haja erro com o Opus 4.6, o campo speed mostra corretamente "standard".
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5-5",
max_tokens=1024,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[{"role": "user", "content": "Hello"}],
)
print(response.usage.speed) # "fast" or "standard"{
"id": "msg_01XFDUDYJgAACzvnptvVoYEL",
"type": "message",
"role": "assistant",
"usage": {
"input_tokens": 8,
"output_tokens": 12,
"speed": "fast"
}
}Para acompanhar o uso e os custos do modo rápido em toda a sua organização, consulte a API de Uso e Custo.
Novas tentativas e fallback
Novas tentativas automáticas
Quando os limites de taxa do modo rápido são excedidos, a API retorna um erro 429 com um cabeçalho retry-after. Por padrão, os SDKs da Anthropic repetem automaticamente essas requisições até 2 vezes (configurável com max_retries) e aguardam o atraso especificado pelo servidor antes de cada nova tentativa. Como o modo rápido usa reposição contínua de tokens, o atraso de retry-after costuma ser curto, e as requisições são bem-sucedidas assim que há capacidade disponível.
Recorrendo à velocidade padrão
Se você preferir recorrer à velocidade padrão em vez de esperar por capacidade do modo rápido, capture o erro de limite de taxa e repita a requisição sem speed: "fast". Defina max_retries como 0 na requisição rápida inicial. Assim, as novas tentativas automáticas são ignoradas e a requisição falha imediatamente em erros de limite de taxa.
Definir max_retries como 0 também desativa as novas tentativas para outros erros transitórios (sobrecarga, erros internos do servidor). Por isso, os exemplos a seguir reenviam a requisição original com as novas tentativas padrão nesses casos.
client = anthropic.Anthropic()
def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
try:
return client.with_options(max_retries=max_retries).beta.messages.create(
**params
)
except anthropic.RateLimitError:
if params.get("speed") == "fast":
del params["speed"]
return create_message_with_fast_fallback(max_retries=max_retries, **params)
raise
except (
anthropic.APIStatusError,
anthropic.APIConnectionError,
) as error:
if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
raise
if max_attempts > 1:
return create_message_with_fast_fallback(
max_retries=max_retries, max_attempts=max_attempts - 1, **params
)
raise
message = create_message_with_fast_fallback(
model="claude-opus-5-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello"}],
betas=["fast-mode-2026-02-01"],
speed="fast",
max_retries=0,
)Considerações
- Cache de prompt: Alternar entre a velocidade rápida e a padrão invalida o cache de prompt. Requisições em velocidades diferentes não compartilham prefixos em cache.
- Modelos compatíveis: O modo rápido é compatível com Claude Opus 5.5, Claude Opus 5, e Claude Opus 4.8. Consulte Modelos compatíveis.
- TTFT: Os benefícios do modo rápido se concentram em tokens de saída por segundo (OTPS), e não no tempo até o primeiro token (TTFT).
- Batch API: O modo rápido não está disponível com a Batch API.
- Priority Tier: O modo rápido não está disponível com um compromisso de Priority Tier.
- Claude Platform on AWS: O modo rápido não está disponível atualmente no Claude Platform on AWS.
Próximos passos
Obtenha resultados JSON validados de fluxos de trabalho de agentes.
Saiba mais sobre a estrutura de preços da Anthropic para modelos e recursos.
Controle quantos tokens Claude usa ao responder com o parâmetro effort, equilibrando entre a profundidade da resposta e a eficiência de tokens.
Faça streaming das respostas da Messages API de forma incremental com server-sent events, incluindo deltas de texto, uso de ferramentas e pensamento estendido.
Was this page helpful?