Per sapere come la "zero data retention" (conservazione zero dei dati), o ZDR, si applica a questa funzionalità, consulta API e conservazione dei dati.
Il pensiero di Claude è adattivo: il modello valuta ogni richiesta e decide autonomamente se pensare e quanto. Tu imposti un intento, specifichi facoltativamente l'effort, e il modello alloca il ragionamento dove giudica che il ragionamento sarà utile.
Questo rende il pensiero particolarmente adatto a carichi di lavoro che mescolano richieste banali e complesse, e a flussi di lavoro agentici a lungo orizzonte in cui la giusta quantità di ragionamento varia da un passo all'altro.
Per sapere come attivare il pensiero, come leggere l'output del pensiero e per l'output del pensiero su Claude Fable 5 e Claude Mythos 5, consulta la panoramica sul Pensiero. Questa pagina spiega come Claude decide quando pensare, come guidare quella decisione, e le meccaniche di caching, costo e prezzi che ne derivano.
Il pensiero è facoltativo per il modello. A ogni richiesta, Claude valuta la complessità dell'input e decide se un ragionamento più approfondito migliorerebbe la risposta. Una semplice domanda fattuale può ricevere una risposta diretta senza alcun blocco di pensiero; un problema matematico a più passaggi o un compito di debugging complicato attiva un ragionamento più profondo.
La decisione avviene per ogni richiesta. La stessa conversazione può contenere turni con e senza pensiero, e un turno in cui Claude ha scelto di non pensare non contiene alcun blocco di pensiero. Non costruire logica applicativa che presuppone che ogni turno dell'assistente inizi con uno.
Il controllo principale su questa decisione è il parametro effort, che agisce come guida soft su quanto Claude dovrebbe essere disposto a pensare e quanto in profondità; consulta Livelli di effort in questa pagina per sapere cosa fa ciascun livello.
Se vuoi che Claude pensi meno spesso, abbassa il livello di effort prima di ricorrere alla guida basata sui prompt.
Il pensiero si intercala anche automaticamente con l'uso degli strumenti: Claude può pensare tra le chiamate agli strumenti, riflettendo su ogni risultato dello strumento prima di decidere cosa fare dopo (pensiero intercalato). Non hai bisogno di un header beta o di alcuna configurazione aggiuntiva per questo.
Per il quadro completo di come interagiscono la configurazione del pensiero e il parametro effort, consulta Pensiero ed effort.
Se Claude pensa in un determinato turno è controllabile tramite prompt. L'effort imposta la postura generale, ma puoi anche modellare la decisione direttamente con indicazioni in linguaggio naturale, sia globalmente nel prompt di sistema sia per singolo messaggio dal turno dell'utente.
Usa le due leve insieme in questo ordine:
Per indicazioni più ampie sul prompting con il pensiero, consulta sfruttare le capacità di pensiero e pensiero intercalato.
L'effort è la leva di guida principale per il pensiero. Ogni livello imposta un valore predefinito diverso per quanto spesso Claude pensa e quanto in profondità:
| Livello di effort | Comportamento del pensiero |
|---|---|
max | Claude pensa sempre senza vincoli sulla profondità del pensiero. |
xhigh | Claude pensa sempre in profondità con esplorazione estesa. |
high (predefinito) | Claude pensa quasi sempre. Fornisce ragionamento approfondito su compiti complessi. |
medium | Claude usa un pensiero moderato. Può saltare il pensiero per query semplici. |
low | Claude minimizza il pensiero. Salta il pensiero per compiti semplici in cui la velocità conta di più. |
Questa tabella descrive come ogni livello modifica il comportamento del pensiero. Per indicazioni su quale livello scegliere per un determinato carico di lavoro, incluse le raccomandazioni per modello, consulta Quando regolare il parametro effort nella pagina dedicata all'effort.
L'effort si imposta in output_config.effort, non all'interno dell'oggetto thinking; per esempi completi per ogni linguaggio, consulta Effort.
{
"model": "claude-opus-4-8",
"max_tokens": 4096,
"output_config": { "effort": "medium" },
"messages": [{ "role": "user", "content": "..." }]
}La disponibilità dei livelli varia in base al modello; la tabella di disponibilità dell'effort nella pagina dedicata all'effort è il riferimento autorevole per sapere quali livelli supporta ciascun modello.
Le indicazioni nel prompt di sistema spostano la soglia di pensiero di Claude per ogni richiesta nella conversazione. Se Claude pensa più spesso di quanto il tuo carico di lavoro richieda, aggiungi indicazioni come questa al tuo prompt di sistema:
Extended thinking adds latency and should only be used when it
will meaningfully improve answer quality, typically for problems
that require multistep reasoning. When in doubt, respond directly.Per incoraggiare invece il pensiero, usa una frase come:
This task involves multistep reasoning. Think carefully before responding.L'efficacia della guida può essere sensibile alla formulazione esatta. Se una formulazione non produce il comportamento desiderato, prova una variante più diretta.
Puoi anche guidare il pensiero per singolo messaggio dal turno dell'utente, indipendentemente dal prompt di sistema. Aggiungere "Please think hard before responding." a un messaggio utente incoraggia Claude a pensare in quel turno; "Answer directly without deliberating." lo sopprime.
La guida per singolo messaggio è utile quando solo alcune richieste in una conversazione giustificano un ragionamento esteso. Un harness per agenti, ad esempio, può aggiungere la frase di incoraggiamento nei passaggi di pianificazione e la frase di soppressione nelle conferme di routine, senza toccare il prompt di sistema o modificare alcun parametro della richiesta tra i turni.
La guida basata sui prompt modifica il comportamento del modello, quindi trattala come qualsiasi altra modifica al prompt: misura prima di rilasciare. Esegui un campione rappresentativo del tuo traffico con e senza le indicazioni, e confronta quanto spesso si attiva il pensiero (la presenza di blocchi di pensiero nelle risposte), l'uso di token di output, la latenza e la qualità delle risposte nei casi che contano per te.
Guidare Claude a pensare meno spesso può ridurre la qualità nei compiti che beneficiano del ragionamento. Abbassare il livello di effort è di solito la prima leva migliore, poiché è un controllo calibrato piuttosto che un'istruzione sensibile alla formulazione. Misura l'impatto sui tuoi carichi di lavoro specifici prima di distribuire in produzione la regolazione basata sui prompt.
Tre meccaniche derivano dal fatto che Claude gestisce autonomamente il proprio pensiero: la validazione dei turni, la cache dei prompt e come limitare il costo.
I turni dell'assistente non devono necessariamente iniziare con un blocco di pensiero. (I modelli che usano un budget di pensiero manuale legacy impongono che il turno finale dell'assistente di una richiesta con pensiero abilitato inizi con uno; consulta Struttura dei turni in modalità manuale.)
Per le applicazioni multi-turno, questo significa che puoi ripassare la cronologia della conversazione in qualsiasi forma tu la abbia:
Il rilassamento riguarda la validazione, non ciò che dovresti inviare. Quando hai blocchi di pensiero, ripassali senza modifiche, in particolare durante l'uso degli strumenti, dove trasportano il ragionamento dietro le chiamate agli strumenti di Claude. Consulta la panoramica sul Pensiero per le regole complete.
Le richieste consecutive che mantengono la stessa configurazione di pensiero e lo stesso livello di effort preservano la cache dei prompt; consulta Pensiero e cache dei prompt per le regole complete. Il valore di effort risolto viene reso nel prompt, quindi modificarlo tra le richieste invalida i breakpoint della cache, proprio come fa la modifica del parametro legacy budget_tokens sui modelli che lo usano. Impostare effort esplicitamente al valore predefinito del modello equivale a ometterlo e non interrompe la cache.
La conseguenza pratica: scegli una configurazione di pensiero e un livello di effort per conversazione e mantienili. Se alcuni turni hanno bisogno di più o meno pensiero, guida con il prompting per singolo messaggio: le indicazioni aggiunte al messaggio utente più recente lasciano intatti i breakpoint della cache precedenti, mentre una modifica alla configurazione o all'effort no.
L'esempio seguente dimostra l'invalidazione con uno script multi-turno che puoi eseguire tu stesso:
Non imposti un budget di token per il pensiero. Due controlli limitano il costo:
max_tokens è un limite rigido sull'output totale della richiesta, pensiero e testo di risposta combinati. Claude non genera mai oltre questo limite. In un ciclo di uso degli strumenti, ogni richiesta nel turno ha il proprio max_tokens, quindi non limita la spesa dell'intero turno.effort è una guida soft su quanta parte di quell'output Claude alloca al pensiero. Modella il comportamento ma non garantisce un conteggio di token.Poiché il pensiero conta ai fini di max_tokens, impostalo abbastanza alto da lasciare spazio sia al ragionamento sia alla risposta. Un max_tokens dimensionato per una risposta senza pensiero è spesso troppo piccolo una volta che Claude inizia a pensare su richieste difficili.
Con effort high e superiore, Claude può pensare estensivamente ed è più probabile che esaurisca il budget. Se vedi stop_reason: "max_tokens" nelle risposte, hai due rimedi:
max_tokens per dare al modello più spazio per il pensiero più la risposta.Quale sia quello giusto dipende dal fatto che le risposte troncate avessero bisogno del ragionamento. Se la qualità su quelle richieste è importante, aumenta il limite; se erano state pensate eccessivamente, abbassa l'effort.
Il pensiero comporta addebiti per:
Quando il pensiero è attivo, un prompt di sistema specializzato viene incluso automaticamente per supportare questa funzionalità.
Ciò per cui vieni fatturato è lo stesso indipendentemente dall'impostazione display; cambia solo ciò che vedi:
display: "summarized" | display: "omitted" | |
|---|---|---|
| Token di input | I token nella tua richiesta originale | Uguale a summarized |
| Token di output (fatturati) | I token di pensiero completi che Claude ha generato internamente | Uguale a summarized |
| Token di output (visibili) | Il testo di pensiero riassunto | Zero token di pensiero (il campo thinking è vuoto) |
| Generazione del riassunto | Nessun addebito | Non applicabile |
Il conteggio dei token di output fatturati non corrisponde al conteggio dei token visibili nella risposta. Vieni fatturato per l'intero processo di pensiero, non per il contenuto di pensiero visibile nella risposta.
Per vedere quanti token di output fatturati sono stati spesi per il ragionamento interno, leggi usage.output_tokens_details.thinking_tokens nella risposta. Questo valore riflette il ragionamento grezzo che il modello ha generato (non il testo riassunto restituito nel corpo) ed è sempre minore o uguale a output_tokens. Sottrailo da output_tokens per approssimare la porzione non di ragionamento dell'output. Durante lo streaming, questa suddivisione appare solo nell'evento message_delta finale.
{
"usage": {
"input_tokens": 25,
"output_tokens": 348,
"output_tokens_details": {
"thinking_tokens": 312
}
}
}output_tokens rimane il totale inclusivo e autorevole usato per la fatturazione. output_tokens_details è una suddivisione di sola lettura per l'osservabilità. Per informazioni complete sui prezzi, incluse le tariffe base, le scritture in cache, gli hit della cache e i token di output, consulta Prezzi.
Attiva il pensiero, leggi l'output del pensiero e verifica il supporto per modello.
Preserva i blocchi di pensiero tra le chiamate agli strumenti e gestisci il pensiero nelle conversazioni multi-turno.
Controlla quanto pensiero e output Claude alloca per richiesta.
Was this page helpful?