Claude Opus 4.8 è progettato per la programmazione agentica complessa e il lavoro aziendale. Si basa su Claude Opus 4.7. Questa pagina riassume tutte le novità al momento del lancio, inclusa la "fast mode" (modalità veloce, anteprima di ricerca sull'API di Claude) e una lunghezza minima del prompt memorizzabile in cache ridotta a 1.024 token.
| Modello | ID modello API | Descrizione |
|---|---|---|
| Claude Opus 4.8 | claude-opus-4-8 | Per la programmazione agentica complessa e il lavoro aziendale |
Claude Opus 4.8 supporta la finestra di contesto da 1M di token per impostazione predefinita sull'API di Claude, Amazon Bedrock, Google Cloud e Microsoft Foundry, 128k token di output massimi, l'adaptive thinking (pensiero adattivo) e lo stesso insieme di strumenti e funzionalità della piattaforma di Claude Opus 4.7.
Per prezzi e specifiche complete, consulta la panoramica dei modelli.
Claude Opus 4.8 accetta messaggi con role: "system" immediatamente dopo un turno dell'utente nell'array messages (soggetto alle regole di posizionamento). Questo ti consente di aggiungere istruzioni aggiornate più avanti in una conversazione di lunga durata senza ripetere l'intero prompt di sistema. Aggiornare le istruzioni in questo modo preserva i riscontri della cache dei prompt sui turni precedenti e riduce il costo di input nei cicli agentici. Non è richiesto alcun header beta. Consulta Messaggi di sistema a metà conversazione per i dettagli sull'utilizzo.
L'oggetto stop_details nelle risposte di rifiuto (disponibile da Claude Opus 4.7) è ora documentato pubblicamente. Quando Claude rifiuta di completare una richiesta, questo oggetto descrive la categoria del rifiuto, in aggiunta allo stop reason refusal esistente. La tua applicazione può usarlo per distinguere diverse classi di richieste rifiutate e indirizzare l'utente al passaggio successivo corretto. Non è richiesto alcun header beta. Consulta Rifiuti e fallback per l'elenco delle categorie e Stop reason e fallback per indicazioni sulla gestione.
Il valore predefinito del parametro effort su Claude Opus 4.8 è high su tutte le superfici, incluse l'API di Claude e Claude Code. Se oggi imposti effort esplicitamente, la tua impostazione rimane invariata. Consulta Effort per indicazioni su ciascun livello.
La fast mode (modalità veloce) è ora disponibile per Claude Opus 4.8 come anteprima di ricerca sull'API di Claude. Imposta speed: "fast" con l'header beta fast-mode-2026-02-01 per ottenere fino a 2,5 volte più token di output al secondo dallo stesso modello a un prezzo premium. Consulta Fast mode per accesso, modelli supportati e prezzi.
La lunghezza minima del prompt memorizzabile in cache su Claude Opus 4.8 è di 1.024 token, ridotta rispetto ai 2.048 token di Claude Opus 4.7. I prompt che erano troppo brevi per essere memorizzati in cache su Claude Opus 4.7 possono ora creare voci di cache senza modifiche al codice. Consulta Cache dei prompt per i minimi per modello.
Questi vincoli sono invariati rispetto a Claude Opus 4.7, quindi il codice che già funziona su Claude Opus 4.7 non richiede modifiche. Si applicano solo alla Messages API. I Claude Managed Agents non sono interessati.
Impostare temperature, top_p o top_k su un valore non predefinito restituisce un errore 400 su Claude Opus 4.8, come su Claude Opus 4.7. Ometti questi parametri e usa il prompting per guidare il comportamento del modello.
Come Claude Opus 4.7, Claude Opus 4.8 non supporta i budget di pensiero esteso. Impostare thinking: {type: "enabled", budget_tokens: N} restituisce un errore 400.
Il seguente diff aggiorna una richiesta scritta per Claude Opus 4.6 o versioni precedenti per funzionare su Claude Opus 4.8. Le righe rimosse (-) impostano il vecchio ID del modello e il budget di pensiero manuale che Claude Opus 4.8 rifiuta. Le righe aggiunte (+) impostano il nuovo ID del modello, passano all'adaptive thinking e controllano la profondità del pensiero con il parametro effort, passato nel campo di primo livello output_config. Il modello determina quando e quanto pensare a ogni turno. Se rimuovi completamente il campo thinking, le richieste vengono eseguite senza pensiero:
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
- model="claude-opus-4-6",
+ model="claude-opus-4-8",
max_tokens=16000,
- thinking={"type": "enabled", "budget_tokens": 10000},
+ thinking={"type": "adaptive"},
+ output_config={"effort": "high"},
messages=[
{
"role": "user",
"content": "Explain why the sum of two even numbers is always even.",
}
],
)Rispetto a Claude Opus 4.7, Claude Opus 4.8 punta a miglioramenti comportamentali in:
Con l'adaptive thinking abilitato, Claude Opus 4.8 attiva il ragionamento solo quando determina che il turno ne ha bisogno. Su ricerche semplici e brevi passaggi agentici risponde direttamente. Su problemi complessi a più passaggi ragiona prima di rispondere. Questo riduce i token di pensiero sprecati su carichi di lavoro bimodali rispetto a Claude Opus 4.7 allo stesso livello di effort. Come su Claude Opus 4.7, il pensiero è disattivato a meno che tu non imposti esplicitamente thinking: {type: "adaptive"} nella tua richiesta.
Questi non sono cambiamenti che interrompono la compatibilità dell'API, ma potrebbero richiedere aggiornamenti ai prompt. Consulta Migrazione a Claude Opus 4.8 per indicazioni complete.
medium consente un po' più di pensiero, high un po' meno e xhigh sostanzialmente di più. Se hai ottimizzato un livello di effort rispetto a Claude Opus 4.7, ristabilisci la baseline di costo e latenza a quel livello prima di modificarlo.Per istruzioni di migrazione passo passo e la checklist completa di migrazione, consulta Migrazione a Claude Opus 4.8. Se stai effettuando l'aggiornamento da Claude Opus 4.6 o versioni precedenti, applica anche i passaggi di migrazione di Claude Opus 4.7. Tali passaggi coprono cambiamenti che interrompono la compatibilità che l'aggiornamento a Claude Opus 4.8 da solo non copre. Se usi Claude Code o l'Agent SDK, la skill Claude API può applicare automaticamente questi passaggi di migrazione alla tua base di codice.
Guida per la migrazione ai modelli Claude più recenti dalle versioni precedenti di Claude.
Controlla quanti token Claude utilizza quando risponde con il parametro effort, bilanciando la completezza della risposta e l'efficienza dei token.
Lascia che Claude determini dinamicamente quando e quanto utilizzare il pensiero esteso con la modalità adaptive thinking.
Come i messaggi di sistema a metà conversazione preservano i riscontri della cache.
Scopri cosa significa ogni valore di stop_reason e come gestire troncamento, uso degli strumenti, turni in pausa e rifiuti nella tua applicazione.
Ottieni fino a 2,5 volte più token di output al secondo dai modelli Claude Opus.
Was this page helpful?