"Extended thinking" (pemikiran diperpanjang) dalam mode manual memberi Anda kontrol langsung atas seberapa banyak Claude berpikir. Anda menetapkan anggaran token pemikiran pada setiap permintaan dengan thinking: {type: "enabled", budget_tokens: N}, dan Claude berpikir sesuai anggaran tersebut sebelum mulai menghasilkan jawaban akhirnya. Mode manual tetap berguna ketika beban kerja Anda memerlukan "latency" (latensi) yang dapat diprediksi atau kontrol yang presisi atas biaya pemikiran. Halaman ini membahas cara menetapkan dan menyetel anggaran, bagaimana mode manual berinteraksi dengan pemikiran berselang dan caching prompt, serta cara bermigrasi ke pemikiran adaptif.
Untuk cara kerja pemikiran itu sendiri, termasuk blok pemikiran dan bentuk respons, parameter display, streaming, pemikiran dengan penggunaan alat, dan enkripsi, lihat ikhtisar pemikiran.
Ketersediaan pemikiran diperpanjang per model, termasuk model di mana pemikiran diperpanjang adalah satu-satunya mode, tercantum dalam tabel konfigurasi per model.
Berikut adalah contoh penggunaan pemikiran diperpanjang dalam Messages API:
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-sonnet-4-6",
max_tokens=16000,
thinking={"type": "enabled", "budget_tokens": 10000},
messages=[
{
"role": "user",
"content": "Are there an infinite number of prime numbers such that n mod 4 == 3?",
}
],
)
# Respons berisi blok pemikiran yang diringkas dan blok teks
for block in response.content:
match block.type:
case "thinking":
print(f"\nThinking summary: {block.thinking}")
case "text":
print(f"\nResponse: {block.text}")Untuk mengaktifkan pemikiran diperpanjang manual, tambahkan objek thinking dengan type diatur ke enabled dan nilai budget_tokens.
Parameter budget_tokens menetapkan target untuk berapa banyak token yang dapat digunakan Claude untuk proses penalaran internalnya. Anggaran yang lebih besar dapat meningkatkan kualitas respons dengan memungkinkan analisis yang lebih menyeluruh untuk masalah yang kompleks.
budget_tokens harus memenuhi batasan berikut:
max_tokens. Token pemikiran dihitung terhadap batas max_tokens untuk giliran tersebut, sehingga anggaran harus menyisakan ruang untuk respons akhir. Satu-satunya pengecualian adalah pemikiran berselang, di mana budget_tokens dapat melebihi max_tokens karena anggaran mencakup semua blok pemikiran dalam satu giliran asisten.budget_tokens harus kurang dari max_tokens, pemikiran diperpanjang tidak dapat dikombinasikan dengan max_tokens: 0 (pre-warming cache).Anggaran adalah target, bukan batas ketat. Penggunaan token aktual bervariasi sesuai tugas, dan Claude mungkin berhenti bernalar jauh sebelum anggaran habis; max_tokens tetap menjadi batas keras pada total output.
Pada Claude Opus 4.5, satu-satunya model khusus pemikiran diperpanjang yang mendukung effort, effort membentuk respons keseluruhan sementara budget_tokens menetapkan kedalaman pemikiran; atur keduanya.
Untuk menyetel anggaran:
Untuk melacak berapa biaya aktual dari suatu anggaran, pantau field usage.output_tokens_details.thinking_tokens dalam respons, yang melaporkan berapa banyak dari token output yang ditagih merupakan penalaran internal. Saat streaming, rincian ini hanya muncul pada event message_delta terakhir.
Ketika Anda siap untuk beralih dari anggaran manual, lihat Migrasi ke pemikiran adaptif.
"Interleaved thinking" (pemikiran berselang) memungkinkan Claude berpikir di antara panggilan alat dalam satu giliran asisten, bernalar tentang setiap hasil alat sebelum memutuskan apa yang harus dilakukan selanjutnya. Untuk konsep, struktur giliran, dan bagaimana perilakunya pada model pemikiran adaptif, lihat pemikiran berselang dalam ikhtisar pemikiran. Bagian ini membahas cara mengaktifkannya ketika Anda menggunakan pemikiran manual type: "enabled".
Pada Claude Opus 4.5, Claude Sonnet 4.5, dan model Claude 4 sebelumnya (Claude Opus 4.1, Claude Opus 4, dan Claude Sonnet 4), tambahkan header beta interleaved-thinking-2025-05-14 ke permintaan API Anda.
Generasi 4.6 terbagi dalam mode manual:
type: "enabled" manual masih berfungsi tetapi sudah usang (deprecated). Lebih baik gunakan pemikiran adaptif, yang menyelang secara otomatis tanpa header.thinking: {type: "adaptive"} jika Anda memerlukan penalaran di antara panggilan alat pada model ini.Claude Haiku 4.5 tidak mendukung pemikiran berselang. Pada Claude API, header beta diterima tetapi diabaikan.
Dua pertimbangan lain untuk pemikiran berselang dalam mode manual:
budget_tokens dapat melebihi max_tokens di sini; aturan anggaran menjelaskan pengecualian ini.Cara platform memperlakukan header beta berbeda-beda. Claude API dan Claude Platform di AWS menerima interleaved-thinking-2025-05-14 pada model apa pun dan mengabaikannya jika tidak didukung. Penerimaan tidak sama dengan efek: pada model yang menolak type: "enabled" (4.7 dan yang lebih baru) atau tidak memiliki penyelangan mode manual (Claude Opus 4.6), header tidak memiliki efek mode manual; pemikiran adaptif menyelang secara otomatis di sana.
Platform yang dioperasikan mitra (Amazon Bedrock dan Google Cloud) juga menerima header pada model apa pun tanpa mengembalikan error, dan mengabaikannya pada model yang tidak mendukung pemikiran berselang.
Aturan umum struktur giliran, termasuk loop penggunaan alat satu giliran, penanganan konflik di tengah giliran, dan pengalihan pemikiran antar giliran, ada di Pemikiran dengan penggunaan alat.
Mode manual menambahkan satu persyaratan: giliran asisten terakhir dari permintaan dengan pemikiran aktif harus dimulai dengan blok pemikiran (pemikiran adaptif menghilangkan persyaratan tersebut). Mengubah konfigurasi pemikiran antar giliran juga membatalkan caching prompt; lihat bagian berikut.
Mode manual menambahkan satu aturan di atas perilaku caching yang netral mode yang dijelaskan dalam pemikiran dan caching prompt: mengubah budget_tokens antar permintaan membatalkan breakpoint cache, sama seperti beralih mode pemikiran, karena nilai anggaran dirender ke dalam prompt. Breakpoint tingkat pesan selalu gagal setelah perubahan anggaran; apakah breakpoint alat dan prompt sistem juga gagal tergantung pada di mana model merender konfigurasi.
Dalam praktiknya, pilih anggaran dan pertahankan stabil selama masa percakapan yang di-cache. Menjalankan percakapan multi-giliran dengan caching tingkat pesan pada Claude Sonnet 4.6 dan mengubah anggaran pada permintaan ketiga dari 4.000 menjadi 8.000 token menunjukkan pembatalan secara langsung:
First request - establishing cache
First response usage: { cache_creation_input_tokens: 1370, cache_read_input_tokens: 0, input_tokens: 17, output_tokens: 700 }
Second request - same thinking parameters (cache hit expected)
Second response usage: { cache_creation_input_tokens: 0, cache_read_input_tokens: 1370, input_tokens: 303, output_tokens: 874 }
Third request - different thinking budget (cache miss expected)
Third response usage: { cache_creation_input_tokens: 1370, cache_read_input_tokens: 0, input_tokens: 747, output_tokens: 619 }Permintaan ketiga membuat ulang cache (cache_creation_input_tokens=1370, cache_read_input_tokens=0) karena anggaran berubah antar permintaan. Untuk versi yang dapat dijalankan dari eksperimen yang sama dalam mode adaptif, di mana tingkat effort memainkan peran cache yang dimainkan budget_tokens di sini, lihat Caching prompt di halaman pengarahan.
Sebagian besar perilaku pemikiran bersifat netral mode dan didokumentasikan sekali di halaman Pemikiran. Semua yang ada di sana juga berlaku dalam mode manual:
Jika model Anda hanya mendukung pemikiran diperpanjang (Claude Sonnet 4.5, Claude Opus 4.5, Claude Haiku 4.5, dan model Claude 4 sebelumnya), tidak ada tindakan yang diperlukan sekarang: pemikiran adaptif tidak tersedia di sana, dan type: "adaptive" mengembalikan error 400. Pertahankan budget_tokens sampai Anda beralih ke model yang mendukung pemikiran adaptif, lalu terapkan pemetaan berikut.
Anda perlu bermigrasi dari type: "enabled" jika:
budget_tokens sudah usang (deprecated).type: "enabled" mengembalikan error 400.Pemetaannya sederhana: hapus budget_tokens, atur thinking: {type: "adaptive"}, dan kontrol kedalaman penalaran dengan output_config: {effort: ...} alih-alih anggaran token.
{
"model": "claude-sonnet-4-6",
"max_tokens": 16000,
"thinking": {
"type": "enabled",
"budget_tokens": 10000
}
}menjadi:
{
"model": "claude-sonnet-4-6",
"max_tokens": 16000,
"thinking": {
"type": "adaptive"
},
"output_config": {
"effort": "high"
}
}effort: "high" sesuai dengan default API; ini muncul di sini hanya untuk menunjukkan di mana kontrol kedalaman sekarang berada, dan menghilangkannya menghasilkan perilaku yang identik.
Harapkan perbedaan perilaku, bukan hanya perubahan sintaks. Dengan anggaran tetap, Claude berpikir pada setiap permintaan. Dengan pemikiran adaptif, Claude memutuskan apakah dan seberapa banyak berpikir pada setiap permintaan, dan pada pengaturan effort yang lebih rendah, Claude mungkin melewatkan pemikiran sepenuhnya pada input yang mudah. Anda juga dapat menghapus header beta interleaved-thinking-2025-05-14 setelah bermigrasi: pemikiran adaptif menyelang secara otomatis, dan Claude API mengabaikan header pada model-model ini. Pelestarian blok pemikiran juga berubah: Claude Opus 4.5 dan model bernomor 4.6 dan lebih tinggi mempertahankan blok pemikiran giliran sebelumnya dalam konteks dan menagihnya sebagai input, sedangkan Claude Sonnet 4.5, Claude Haiku 4.5, dan model sebelumnya menghapusnya; lihat pelestarian blok pemikiran berdasarkan model.
Beralih mode adalah perubahan konfigurasi pemikiran, sehingga permintaan pertama setelah peralihan membatalkan breakpoint cache, seperti yang dijelaskan dalam Caching prompt dalam mode manual.
Untuk panduan lengkap, lihat pemikiran adaptif, effort, dan panduan migrasi model.
Pelajari cara kerja pemikiran: blok, tampilan, streaming, dan penggunaan alat.
Biarkan Claude memutuskan kapan dan seberapa banyak berpikir pada setiap permintaan.
Pertahankan blok pemikiran dan kelola pemikiran di seluruh panggilan alat dan giliran.
Was this page helpful?