Claude Platform Docs
Best practiceTestare e valutare

Ridurre la latenza

Riduci la latenza di risposta di Claude scegliendo un modello più veloce come Claude Haiku 4.5, riducendo i token del prompt e dell'output e usando lo streaming delle risposte.

La "latency" (latenza) si riferisce al tempo necessario al modello per elaborare un prompt e generare un output. La latenza può essere influenzata da vari fattori, come la dimensione del modello, la complessità del prompt e l'infrastruttura sottostante che supporta il modello e il punto di interazione.


Come misurare la latenza

Quando si parla di latenza, potresti incontrare diversi termini e misurazioni:

  • Latenza di base (baseline latency): È il tempo impiegato dal modello per elaborare il prompt e generare la risposta, senza considerare i token di input e di output al secondo. Fornisce un'idea generale della velocità del modello.
  • "Time to first token" (tempo al primo token), o TTFT: Questa metrica misura il tempo necessario al modello per generare il primo token della risposta, a partire dal momento in cui il prompt è stato inviato. È particolarmente rilevante quando usi lo streaming (ne parleremo più avanti) e vuoi offrire un'esperienza reattiva ai tuoi utenti.

Per una comprensione più approfondita di questi termini, consulta il glossario.


Come ridurre la latenza

1. Scegli il modello giusto

Uno dei modi più diretti per ridurre la latenza è selezionare il modello appropriato per il tuo caso d'uso. Anthropic offre una gamma di modelli con capacità e caratteristiche prestazionali diverse. Considera i tuoi requisiti specifici e scegli il modello che meglio si adatta alle tue esigenze in termini di velocità e qualità dell'output.

Per applicazioni in cui la velocità è critica, Claude Haiku 4.5 offre i tempi di risposta più rapidi mantenendo un'elevata intelligenza:

client = anthropic.Anthropic()

# Per applicazioni sensibili al tempo, usa Claude Haiku 4.5
message = client.messages.create(
    model="claude-haiku-4-5",
    max_tokens=100,
    messages=[
        {
            "role": "user",
            "content": "Summarize this customer feedback in 2 sentences: [feedback text]",
        }
    ],
)
print(message.content[0].text)

Per maggiori dettagli sulle metriche dei modelli, consulta la pagina di panoramica dei modelli.

2. Ottimizza la lunghezza del prompt e dell'output

Riduci al minimo il numero di token sia nel prompt di input sia nell'output atteso, mantenendo comunque prestazioni elevate. Meno token il modello deve elaborare e generare, più veloce sarà la risposta.

Ecco alcuni suggerimenti per aiutarti a ottimizzare i tuoi prompt e output:

  • Sii chiaro ma conciso: Cerca di trasmettere la tua intenzione in modo chiaro e conciso nel prompt. Evita dettagli non necessari o informazioni ridondanti, tenendo presente che Claude non ha contesto sul tuo caso d'uso e potrebbe non compiere i salti logici previsti se le istruzioni non sono chiare.
  • Chiedi risposte più brevi: Chiedi direttamente a Claude di essere conciso. Se Claude produce output di lunghezza indesiderata, chiedi a Claude di limitare la sua loquacità.
  • Imposta limiti di output appropriati: Usa il parametro max_tokens per impostare un limite rigido alla lunghezza massima della risposta generata. Questo impedisce a Claude di generare output eccessivamente lunghi.
  • Sperimenta con la temperatura: Il parametro temperature controlla la casualità dell'output. Valori più bassi (ad esempio, 0,2) possono talvolta portare a risposte più mirate e brevi, mentre valori più alti (ad esempio, 0,8) potrebbero produrre output più vari ma potenzialmente più lunghi.

Trovare il giusto equilibrio tra chiarezza del prompt, qualità dell'output e numero di token potrebbe richiedere un po' di sperimentazione.

3. Usa lo streaming delle risposte

Lo "streaming" (streaming) è una funzionalità che consente al modello di iniziare a inviare la propria risposta prima che l'output completo sia terminato. Questo può migliorare significativamente la reattività percepita della tua applicazione, poiché gli utenti possono vedere l'output del modello in tempo reale.

Con lo streaming abilitato, puoi elaborare l'output del modello man mano che arriva, aggiornando la tua interfaccia utente o eseguendo altre attività in parallelo.

Visita Streaming dei messaggi per scoprire come implementare lo streaming per il tuo caso d'uso.


Prossimi passi

Riduci al minimo le allucinazioni negli output di Claude consentendo l'incertezza, basando le risposte su citazioni dirette e verificando le affermazioni con citazioni.

Trasmetti in streaming le risposte della Messages API in modo incrementale con server-sent events, inclusi testo, uso degli strumenti e delta del ragionamento esteso.

Was this page helpful?