Claude Platform Docs
MessagesCapacidades do modelo

Modo rápido (prévia de pesquisa)

Obtenha até 2,5x mais tokens de saída por segundo dos modelos Claude Opus compatíveis.

O "fast mode" (modo rápido) oferece até 2,5x mais tokens de saída por segundo com Claude Opus 5.5, Claude Opus 5, e Claude Opus 4.8, com preço premium. Para ativá-lo, defina speed: "fast" com o cabeçalho beta fast-mode-2026-02-01 na sua requisição.

Modelos compatíveis

O modo rápido é compatível com os seguintes modelos:

  • Claude Opus 5.5 ()
  • Claude Opus 5 ()
  • Claude Opus 4.8 ()

Como o modo rápido funciona

O modo rápido executa o mesmo modelo com uma configuração de inferência mais rápida. Não há mudança na inteligência ou nas capacidades.

  • Até 2,5x mais tokens de saída por segundo em comparação com a velocidade padrão
  • Os benefícios de velocidade concentram-se em "output tokens per second" (tokens de saída por segundo), ou OTPS, e não em "time to first token" (tempo até o primeiro token), ou TTFT
  • Mesmos pesos e comportamento do modelo (não é um modelo diferente)
  • Compatível com streaming, onde o ganho de OTPS é mais visível

Uso básico

client = anthropic.Anthropic()

response = client.beta.messages.create(
    model="claude-opus-5-5",
    max_tokens=4096,
    speed="fast",
    betas=["fast-mode-2026-02-01"],
    messages=[
        {"role": "user", "content": "Refactor this module to use dependency injection"}
    ],
)

for block in response.content:
    if block.type == "text":
        print(block.text)

Preços

O modo rápido é cobrado com um multiplicador sobre as tarifas padrão em toda a janela de contexto, incluindo requisições com mais de 200 mil tokens de entrada. A tabela a seguir mostra os preços do modo rápido para os modelos compatíveis:

ModeloEntradaSaída
Claude Opus 5.5$8 USD / MTok$40 USD / MTok
Claude Opus 5 / Claude Opus 4.8$10 USD / MTok$50 USD / MTok

Os preços do modo rápido se acumulam com outros modificadores de preço:

Para detalhes completos de preços, consulte a página de Preços.

Limites de taxa

O modo rápido tem um "rate limit" (limite de taxa) dedicado, separado dos limites de taxa padrão do Opus. Quando seu limite de taxa do modo rápido é excedido, a API retorna um erro 429 com um cabeçalho retry-after indicando quando haverá capacidade disponível.

A resposta inclui cabeçalhos que indicam o status do seu limite de taxa do modo rápido:

CabeçalhoDescrição
anthropic-fast-input-tokens-limitMáximo de tokens de entrada do modo rápido por minuto
anthropic-fast-input-tokens-remainingTokens de entrada do modo rápido restantes
anthropic-fast-input-tokens-resetHorário em que o limite de tokens de entrada do modo rápido é redefinido
anthropic-fast-output-tokens-limitMáximo de tokens de saída do modo rápido por minuto
anthropic-fast-output-tokens-remainingTokens de saída do modo rápido restantes
anthropic-fast-output-tokens-resetHorário em que o limite de tokens de saída do modo rápido é redefinido

Para limites de taxa específicos por nível, consulte a página de Limites de taxa.

Verificando qual velocidade foi usada

O objeto usage da resposta inclui um campo speed que indica qual velocidade foi usada, "fast" ou "standard". Solicitar speed: "fast" em um modelo que não é compatível com o modo rápido retorna um erro, assim como exceder os limites de taxa ou a capacidade do modo rápido (um 429 ou 529). Quando uma requisição com speed: "fast" é bem-sucedida, usage.speed é "fast". Se você estiver usando o Claude Opus 4.6 e solicitar o modo rápido, o comportamento dele é único. Em vez de retornar um erro como outros modelos que não são compatíveis com o modo rápido, ele muda silenciosamente para a velocidade padrão. Embora não haja erro com o Opus 4.6, o campo speed mostra corretamente "standard".

client = anthropic.Anthropic()

response = client.beta.messages.create(
    model="claude-opus-5-5",
    max_tokens=1024,
    speed="fast",
    betas=["fast-mode-2026-02-01"],
    messages=[{"role": "user", "content": "Hello"}],
)

print(response.usage.speed)  # "fast" or "standard"
Output
{
  "id": "msg_01XFDUDYJgAACzvnptvVoYEL",
  "type": "message",
  "role": "assistant",

  "usage": {
    "input_tokens": 8,
    "output_tokens": 12,
    "speed": "fast"
  }
}

Para acompanhar o uso e os custos do modo rápido em toda a sua organização, consulte a API de Uso e Custo.

Novas tentativas e fallback

Novas tentativas automáticas

Quando os limites de taxa do modo rápido são excedidos, a API retorna um erro 429 com um cabeçalho retry-after. Por padrão, os SDKs da Anthropic repetem automaticamente essas requisições até 2 vezes (configurável com max_retries) e aguardam o atraso especificado pelo servidor antes de cada nova tentativa. Como o modo rápido usa reposição contínua de tokens, o atraso de retry-after costuma ser curto, e as requisições são bem-sucedidas assim que há capacidade disponível.

Recorrendo à velocidade padrão

Se você preferir recorrer à velocidade padrão em vez de esperar por capacidade do modo rápido, capture o erro de limite de taxa e repita a requisição sem speed: "fast". Defina max_retries como 0 na requisição rápida inicial. Assim, as novas tentativas automáticas são ignoradas e a requisição falha imediatamente em erros de limite de taxa.

Definir max_retries como 0 também desativa as novas tentativas para outros erros transitórios (sobrecarga, erros internos do servidor). Por isso, os exemplos a seguir reenviam a requisição original com as novas tentativas padrão nesses casos.

client = anthropic.Anthropic()


def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
    try:
        return client.with_options(max_retries=max_retries).beta.messages.create(
            **params
        )
    except anthropic.RateLimitError:
        if params.get("speed") == "fast":
            del params["speed"]
            return create_message_with_fast_fallback(max_retries=max_retries, **params)
        raise
    except (
        anthropic.APIStatusError,
        anthropic.APIConnectionError,
    ) as error:
        if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
            raise
        if max_attempts > 1:
            return create_message_with_fast_fallback(
                max_retries=max_retries, max_attempts=max_attempts - 1, **params
            )
        raise


message = create_message_with_fast_fallback(
    model="claude-opus-5-5",
    max_tokens=1024,
    messages=[{"role": "user", "content": "Hello"}],
    betas=["fast-mode-2026-02-01"],
    speed="fast",
    max_retries=0,
)

Considerações

  • Cache de prompt: Alternar entre a velocidade rápida e a padrão invalida o cache de prompt. Requisições em velocidades diferentes não compartilham prefixos em cache.
  • Modelos compatíveis: O modo rápido é compatível com Claude Opus 5.5, Claude Opus 5, e Claude Opus 4.8. Consulte Modelos compatíveis.
  • TTFT: Os benefícios do modo rápido se concentram em tokens de saída por segundo (OTPS), e não no tempo até o primeiro token (TTFT).
  • Batch API: O modo rápido não está disponível com a Batch API.
  • Priority Tier: O modo rápido não está disponível com um compromisso de Priority Tier.
  • Claude Platform on AWS: O modo rápido não está disponível atualmente no Claude Platform on AWS.

Próximos passos

Obtenha resultados JSON validados de fluxos de trabalho de agentes.

Saiba mais sobre a estrutura de preços da Anthropic para modelos e recursos.

Controle quantos tokens Claude usa ao responder com o parâmetro effort, equilibrando entre a profundidade da resposta e a eficiência de tokens.

Faça streaming das respostas da Messages API de forma incremental com server-sent events, incluindo deltas de texto, uso de ferramentas e pensamento estendido.

Was this page helpful?