Claude Platform Docs
MessagesCapacità del modello

Modalità veloce (anteprima di ricerca)

Ottieni fino a 2,5 volte più token di output al secondo dai modelli Claude Opus supportati.

La "fast mode" (modalità veloce) offre fino a 2,5 volte più token di output al secondo da Claude Opus 5 e Claude Opus 4.8 a un prezzo premium. Imposta speed: "fast" con l'header beta fast-mode-2026-02-01 nella tua richiesta per attivarla.

Modelli supportati

La modalità veloce è supportata sui seguenti modelli:

  • Claude Opus 5 ()
  • Claude Opus 4.8 ()

Come funziona la modalità veloce

La modalità veloce esegue lo stesso modello con una configurazione di inferenza più rapida. Non vi è alcun cambiamento nell'intelligenza o nelle capacità.

  • Fino a 2,5 volte più token di output al secondo rispetto alla velocità standard
  • I vantaggi in termini di velocità si concentrano sugli "output tokens per second" (token di output al secondo), o OTPS, non sul "time to first token" (tempo al primo token), o TTFT
  • Stessi pesi e comportamento del modello (non è un modello diverso)
  • Compatibile con lo streaming, dove il guadagno in OTPS è più visibile

Utilizzo di base

client = anthropic.Anthropic()

response = client.beta.messages.create(
    model="claude-opus-5",
    max_tokens=4096,
    speed="fast",
    betas=["fast-mode-2026-02-01"],
    messages=[
        {"role": "user", "content": "Refactor this module to use dependency injection"}
    ],
)

for block in response.content:
    if block.type == "text":
        print(block.text)

Prezzi

La modalità veloce ha un prezzo pari a un moltiplicatore delle tariffe standard sull'intera "context window" (finestra di contesto), incluse le richieste con oltre 200k token di input. La tabella seguente mostra i prezzi della modalità veloce per i modelli supportati:

ModelloInputOutput
Claude Opus 5 / Claude Opus 4.8$10 USD / MTok$50 USD / MTok

I prezzi della modalità veloce si cumulano con altri modificatori di prezzo:

Per i dettagli completi sui prezzi, consulta la pagina Prezzi.

Limiti di velocità

La modalità veloce ha un "rate limit" (limite di velocità) dedicato, separato dai limiti di velocità standard di Opus. Quando il limite di velocità della modalità veloce viene superato, l'API restituisce un errore 429 con un header retry-after che indica quando la capacità sarà disponibile.

La risposta include header che indicano lo stato del tuo limite di velocità della modalità veloce:

HeaderDescrizione
anthropic-fast-input-tokens-limitNumero massimo di token di input in modalità veloce al minuto
anthropic-fast-input-tokens-remainingToken di input in modalità veloce rimanenti
anthropic-fast-input-tokens-resetMomento in cui il limite dei token di input in modalità veloce viene reimpostato
anthropic-fast-output-tokens-limitNumero massimo di token di output in modalità veloce al minuto
anthropic-fast-output-tokens-remainingToken di output in modalità veloce rimanenti
anthropic-fast-output-tokens-resetMomento in cui il limite dei token di output in modalità veloce viene reimpostato

Per i limiti di velocità specifici per livello, consulta la pagina Limiti di velocità.

Verificare quale velocità è stata utilizzata

L'oggetto usage della risposta include un campo speed che indica quale velocità è stata utilizzata, "fast" oppure "standard". Richiedere speed: "fast" su un modello che non supporta la modalità veloce restituisce un errore, così come superare i limiti di velocità o la capacità della modalità veloce (un 429 o 529). Quando una richiesta con speed: "fast" ha successo, usage.speed è "fast". Se stai usando Claude Opus 4.6 e richiedi la modalità veloce, il suo comportamento è unico. Invece di restituire un errore come gli altri modelli che non supportano la modalità veloce, passa silenziosamente alla velocità standard. Sebbene non vi sia alcun errore con Opus 4.6, il campo speed mostra correttamente "standard".

client = anthropic.Anthropic()

response = client.beta.messages.create(
    model="claude-opus-5",
    max_tokens=1024,
    speed="fast",
    betas=["fast-mode-2026-02-01"],
    messages=[{"role": "user", "content": "Hello"}],
)

print(response.usage.speed)  # "fast" or "standard"
Output
{
  "id": "msg_01XFDUDYJgAACzvnptvVoYEL",
  "type": "message",
  "role": "assistant",

  "usage": {
    "input_tokens": 8,
    "output_tokens": 12,
    "speed": "fast"
  }
}

Per monitorare l'utilizzo e i costi della modalità veloce nella tua organizzazione, consulta la Usage and Cost API.

Nuovi tentativi e fallback

Nuovi tentativi automatici

Quando i limiti di velocità della modalità veloce vengono superati, l'API restituisce un errore 429 con un header retry-after. Gli SDK di Anthropic ritentano automaticamente queste richieste fino a 2 volte per impostazione predefinita (configurabile con max_retries), attendendo il ritardo specificato dal server prima di ogni nuovo tentativo. Poiché la modalità veloce utilizza un rifornimento continuo dei token, il ritardo retry-after è in genere breve e le richieste hanno successo non appena la capacità è disponibile.

Ripiegare sulla velocità standard

Se preferisci ripiegare sulla velocità standard anziché attendere la capacità della modalità veloce, intercetta l'errore di limite di velocità e ritenta senza speed: "fast". Imposta max_retries a 0 nella richiesta veloce iniziale per saltare i nuovi tentativi automatici e fallire immediatamente in caso di errori di limite di velocità.

Poiché impostare max_retries a 0 disabilita anche i nuovi tentativi per altri errori transitori (sovraccarico, errori interni del server), gli esempi seguenti riemettono la richiesta originale con i nuovi tentativi predefiniti per questi casi.

client = anthropic.Anthropic()


def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
    try:
        return client.with_options(max_retries=max_retries).beta.messages.create(
            **params
        )
    except anthropic.RateLimitError:
        if params.get("speed") == "fast":
            del params["speed"]
            return create_message_with_fast_fallback(max_retries=max_retries, **params)
        raise
    except (
        anthropic.APIStatusError,
        anthropic.APIConnectionError,
    ) as error:
        if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
            raise
        if max_attempts > 1:
            return create_message_with_fast_fallback(
                max_retries=max_retries, max_attempts=max_attempts - 1, **params
            )
        raise


message = create_message_with_fast_fallback(
    model="claude-opus-5",
    max_tokens=1024,
    messages=[{"role": "user", "content": "Hello"}],
    betas=["fast-mode-2026-02-01"],
    speed="fast",
    max_retries=0,
)

Considerazioni

  • Cache dei prompt: Passare tra velocità veloce e standard invalida la cache dei prompt. Le richieste a velocità diverse non condividono i prefissi memorizzati nella cache.
  • Modelli supportati: La modalità veloce è supportata su Claude Opus 5 e Claude Opus 4.8. Consulta Modelli supportati.
  • TTFT: I vantaggi della modalità veloce si concentrano sui token di output al secondo (OTPS), non sul tempo al primo token (TTFT).
  • Batch API: La modalità veloce non è disponibile con la Batch API.
  • Priority Tier: La modalità veloce non è disponibile con un impegno Priority Tier.
  • Claude Platform on AWS: La modalità veloce non è attualmente disponibile su Claude Platform on AWS.

Prossimi passi

Ottieni risultati JSON validati dai flussi di lavoro degli agenti.

Scopri la struttura dei prezzi di Anthropic per modelli e funzionalità.

Controlla quanti token Claude utilizza nelle risposte con il parametro effort, bilanciando tra completezza della risposta ed efficienza dei token.

Trasmetti in streaming le risposte della Messages API in modo incrementale con server-sent events, inclusi testo, uso degli strumenti e delta del pensiero esteso.

Was this page helpful?