Effort
Kontrol berapa banyak token yang digunakan Claude saat merespons dengan parameter effort, dengan menyeimbangkan antara ketelitian respons dan efisiensi token.
Parameter effort (upaya) memungkinkan Anda mengendalikan berapa banyak token yang dihabiskan Claude saat merespons permintaan. Anda dapat menyeimbangkan antara ketelitian respons dan efisiensi token dengan satu model. Parameter effort tingkat atas tersedia di semua model yang didukung tanpa memerlukan header beta. Effort per pesan masih dalam versi beta.
Mengatur tingkat effort
Atur output_config.effort pada permintaan. Contoh berikut menjalankan satu permintaan dengan effort medium dan mencetak teks respons.
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-opus-5-5",
max_tokens=4096,
messages=[
{
"role": "user",
"content": "Analyze the trade-offs between microservices and monolithic architectures",
}
],
output_config={"effort": "medium"},
)
for block in response.content:
if block.type == "text":
print(block.text)Cara kerja effort
Sebagian besar model Claude secara default menggunakan effort high, menghabiskan token sebanyak yang diperlukan untuk hasil yang sangat baik; Claude Opus 5.5 dan Claude Haiku 5.5 secara default menggunakan medium. Anda dapat menaikkan tingkat effort ke max untuk kemampuan tertinggi mutlak, atau menurunkannya agar lebih hemat dalam penggunaan token, mengoptimalkan kecepatan dan biaya dengan menerima sedikit penurunan kemampuan.
Parameter effort memengaruhi semua token dalam respons, termasuk:
- Respons teks dan penjelasan
- Pemanggilan alat dan argumen fungsi
- Thinking (saat aktif)
Karena effort berlaku untuk setiap token output, effort berfungsi baik thinking diaktifkan maupun tidak. Effort yang lebih rendah juga berarti pemanggilan alat yang lebih sedikit dan lebih ringkas.
Tingkat effort
| Tingkat | Deskripsi | Kasus penggunaan umum |
|---|---|---|
max | Kemampuan maksimum mutlak tanpa batasan pada pengeluaran token. Tersedia di Claude Fable 5.1, Claude Mythos 5.1, Claude Fable 5, Claude Mythos 5, Claude Mythos Preview, Claude Opus 5.5, Claude Opus 5, Claude Opus 4.8, Claude Opus 4.7, Claude Opus 4.6, Claude Sonnet 5.5, Claude Sonnet 5, Claude Sonnet 4.6, dan Claude Haiku 5.5. | Tugas yang memerlukan penalaran sedalam mungkin dan analisis paling menyeluruh |
xhigh | Kemampuan yang diperluas untuk pekerjaan jangka panjang. Tersedia di Claude Fable 5.1, Claude Mythos 5.1, Claude Fable 5, Claude Mythos 5, Claude Opus 5.5, Claude Opus 5, Claude Opus 4.8, Claude Opus 4.7, Claude Sonnet 5.5, Claude Sonnet 5, dan Claude Haiku 5.5. | Tugas agentik dan coding yang berjalan lama (lebih dari 30 menit) dengan anggaran token dalam jutaan |
high | Menghabiskan token sebanyak yang dibutuhkan tugas untuk hasil yang sangat baik. Default pada setiap model yang mendukung effort kecuali Claude Opus 5.5 dan Claude Haiku 5.5. | Penalaran kompleks, masalah coding yang sulit, tugas agentik |
medium | Pendekatan seimbang dengan penghematan token moderat. Default pada Claude Opus 5.5 dan Claude Haiku 5.5. | Tugas agentik yang memerlukan keseimbangan antara kecepatan, biaya, dan kinerja |
low | Paling efisien. Penghematan token yang signifikan dengan sedikit penurunan kemampuan. | Tugas yang lebih sederhana yang membutuhkan kecepatan terbaik dan biaya terendah, seperti subagen |
Tidak setiap model yang mendukung max juga mendukung xhigh.
Rekomendasi per model berikut menggantikan tabel ini jika terdapat perbedaan.
Tingkat effort yang direkomendasikan untuk Claude Fable 5.1
Claude Fable 5.1 mendukung kelima tingkat effort. Mulailah dengan high, nilai default. Naikkan ke xhigh atau max untuk pekerjaan agentic dan coding yang paling sensitif terhadap kemampuan, dan turunkan ke medium atau low untuk pekerjaan rutin atau yang sensitif terhadap latensi setelah evaluasi Anda menunjukkan kualitas tetap terjaga. Pada high dan di atasnya, atur max_tokens yang besar. Ini adalah batas keras untuk total output (thinking ditambah teks respons). Rekomendasi yang sama berlaku untuk Claude Mythos 5.1. Lihat Prompting Claude Fable 5.1.
Claude Fable 5.1 juga mendukung mengubah effort di tengah percakapan dengan output_config per pesan, yang mempertahankan cache prompt.
Tingkat effort yang direkomendasikan untuk Claude Fable 5
Effort adalah kontrol utama untuk menyeimbangkan kecerdasan, latensi, dan biaya pada Claude Fable 5. Mulailah dengan high, nilai default, untuk sebagian besar tugas, gunakan xhigh untuk beban kerja yang paling sensitif terhadap kemampuan, dan turunkan ke medium atau low untuk pekerjaan rutin. Pengaturan effort yang lebih rendah pada Claude Fable 5 tetap berkinerja baik dan sering kali melampaui performa xhigh pada model sebelumnya. Pada high dan xhigh, atur max_tokens yang besar. Ini adalah batas keras untuk total output (thinking ditambah teks respons). Lihat Kontrol biaya.
Kurangi effort jika suatu tugas selesai tetapi memakan waktu lebih lama dari yang diperlukan, atau jika Anda menginginkan gaya kerja yang lebih cepat dan interaktif. Rekomendasi yang sama berlaku untuk Claude Mythos 5. Untuk panduan lebih lengkap, lihat Prompting Claude Fable 5.
Tingkat effort yang direkomendasikan untuk Claude Opus 5.5
Claude Opus 5.5 mendukung kelima tingkat effort, dan medium adalah default-nya (Claude Opus 5 dan model Opus sebelumnya secara default menggunakan high, sehingga permintaan yang menghilangkan effort berjalan satu tingkat lebih rendah dibandingkan pada Claude Opus 5). Pemikiran adaptif selalu aktif dan tidak dapat dinonaktifkan, sehingga effort adalah kontrol utama untuk seberapa banyak model bernalar dan berapa biaya suatu permintaan. Jalankan sweep effort pada eval Anda sendiri alih-alih membawa pengaturan dari model sebelumnya, dan atur max_tokens yang besar pada tingkat yang lebih tinggi: ini adalah batas keras untuk total output (pemikiran ditambah teks respons). Permintaan yang mengatur thinking: {"type": "disabled"} mengembalikan error 400 pada setiap tingkat effort. Claude Opus 5.5 juga mendukung perubahan effort di tengah percakapan dengan output_config per pesan, yang mempertahankan cache prompt. Lihat Prompting Claude Opus 5.5.
Tingkat effort yang direkomendasikan untuk Claude Opus 5
Claude Opus 5 mendukung kelima tingkat effort. Mulailah dengan high, nilai default, dan sesuaikan berdasarkan eval Anda: naikkan ke xhigh untuk pekerjaan coding dan agentik yang menuntut, atau ke max ketika suatu tugas membenarkan pengeluaran token tanpa batas, dan gunakan low dan medium secara leluasa sebagai kontrol utama Anda untuk biaya token dan waktu respons di mana pun eval Anda menunjukkan kualitas tetap terjaga. Jika Anda membawa pengaturan effort dari model sebelumnya, jalankan sweep effort baru pada eval Anda alih-alih menggunakannya kembali.
Effort mengendalikan volume thinking, bukan panjang respons yang terlihat: pada Claude Opus 5, mengubah effort tidak secara andal memperpendek respons, jadi gunakan prompt untuk mengatur panjang sebagai gantinya.
Default API adalah high. Atur effort secara eksplisit untuk menggunakan tingkat yang berbeda. Nilai yang Anda berikan menggantikan default.
Pada Claude Opus 5, thinking tidak dapat dinonaktifkan pada effort xhigh atau max: permintaan yang mengatur thinking: {"type": "disabled"} pada tingkat tersebut mengembalikan error 400. Lihat Effort dengan thinking.
Saat menjalankan Claude Opus 5 pada effort xhigh atau max, atur max_tokens yang besar agar model memiliki ruang untuk berpikir dan bertindak di seluruh subagen dan pemanggilan alat. Memulai dari 64k token dan menyesuaikan dari sana adalah default yang wajar.
Claude Opus 5 juga mendukung mengubah effort di tengah percakapan dengan output_config per pesan, yang mempertahankan cache prompt. Effort per pesan tidak tersedia untuk Claude Opus 5 di Amazon Bedrock.
Tingkat effort yang direkomendasikan untuk Claude Opus 4.8
Panduan untuk Claude Opus 4.7 juga berlaku untuk Claude Opus 4.8. Mulailah dengan xhigh untuk kasus penggunaan coding dan agentic, gunakan high untuk sebagian besar beban kerja lain yang sensitif terhadap kecerdasan, dan turunkan ke medium atau low hanya ketika Anda telah mengukur bahwa tingkat yang lebih rendah tetap menjaga kualitas pada evaluasi Anda.
Default API adalah high. Atur effort secara eksplisit untuk menggunakan tingkat yang berbeda. Nilai yang Anda berikan menggantikan default.
Saat menjalankan Claude Opus 4.8 pada effort xhigh atau max, atur max_tokens yang besar agar model memiliki ruang untuk berpikir dan bertindak di seluruh subagen dan pemanggilan alat. Memulai dari 64k token dan menyesuaikannya dari sana adalah default yang wajar.
Tingkat effort yang direkomendasikan untuk Claude Opus 4.7
Mulailah dengan xhigh untuk kasus penggunaan coding dan agentik, dan gunakan high sebagai minimum untuk sebagian besar beban kerja yang sensitif terhadap kecerdasan. Turunkan ke medium untuk beban kerja yang sensitif terhadap biaya, atau naikkan ke max hanya ketika eval Anda menunjukkan ruang peningkatan yang terukur pada xhigh.
Default API adalah high. Untuk menggunakan xhigh, atur effort secara eksplisit. Nilai yang Anda berikan menggantikan default.
| Effort | Panduan untuk Claude Opus 4.7 |
|---|---|
low | Efisien, tetapi paling baik untuk tugas singkat dengan cakupan terbatas. Pasangkan low dengan daftar periksa eksplisit jika tugas Anda memiliki beberapa bagian. |
medium | Pengganti langsung untuk alur kerja rata-rata di mana Anda menginginkan hasil yang baik sambil mengurangi biaya. |
high | Kasus penggunaan tingkat lanjut yang tetap membutuhkan keseimbangan antara kecerdasan dan konsumsi token. Ini sering kali merupakan keseimbangan terbaik antara kualitas dan efisiensi token. |
xhigh | Titik awal yang direkomendasikan untuk pekerjaan coding dan agentik, serta untuk tugas eksploratif seperti pemanggilan alat berulang, pencarian web terperinci, dan pencarian basis pengetahuan. Perkirakan penggunaan token yang jauh lebih tinggi daripada high. |
max | Simpan untuk masalah frontier. Pada sebagian besar beban kerja, max menambah biaya yang signifikan untuk peningkatan kualitas yang relatif kecil, dan pada beberapa tugas output terstruktur atau yang kurang sensitif terhadap kecerdasan, ini dapat menyebabkan berpikir berlebihan. |
Claude Opus 4.7 juga mematuhi tingkat effort secara lebih ketat daripada Claude Opus 4.6, terutama pada low dan medium. Pada tingkat effort yang lebih rendah, model membatasi pekerjaannya pada apa yang diminta alih-alih melakukan lebih dari yang diminta. Jika Anda mengamati penalaran yang dangkal pada masalah kompleks dengan Claude Opus 4.7, naikkan effort alih-alih mengakalinya dengan prompt. Jika Anda harus mempertahankan effort rendah demi latensi, tambahkan panduan yang terarah seperti "This task involves multistep reasoning. Think carefully before responding."
Saat menjalankan Claude Opus 4.7 pada effort xhigh atau max, atur max_tokens yang besar agar model memiliki ruang untuk berpikir dan bertindak di seluruh subagen dan pemanggilan alat. Memulai dari 64k token dan menyesuaikan dari sana adalah default yang wajar.
Tingkat effort yang direkomendasikan untuk Claude Sonnet 5.5
Claude Sonnet 5.5 mendukung kelima tingkat effort, dan high adalah default di Claude API. Tingkat-tingkatnya telah dikalibrasi ulang, sehingga suatu tingkat tidak menghasilkan jumlah thinking yang sama dengan tingkat yang sama pada Claude Sonnet 5. Jalankan sweep effort baru pada eval Anda alih-alih membawa pengaturan yang Anda gunakan pada Claude Sonnet 5. Mulailah dengan high kecuali beban kerja Anda bersifat agentik atau sensitif terhadap latensi. Untuk coding agentik dan penggunaan alat multilangkah, mulailah dengan medium untuk tugas yang terdefinisi dengan baik dan beralih ke high untuk tugas yang lebih sulit atau lebih panjang. Untuk chat dan pekerjaan lain yang sensitif terhadap latensi, mulailah dengan medium atau low. Gunakan xhigh atau max hanya jika eval Anda menunjukkan peningkatan kualitas. Atur max_tokens dengan ruang untuk thinking dan balasan. Thinking dihitung terhadap max_tokens bahkan ketika konten thinking tidak dikembalikan. Untuk coding agentik, atur max_tokens ke 128.000, nilai maksimum model, dan lakukan streaming pada respons.
Untuk mematikan thinking di awal, kirim thinking: {"type": "between_tools"} alih-alih "disabled". Ini adalah pengaturan thinking terendah pada Claude Sonnet 5.5, dan berfungsi pada effort low, medium, dan high. Pada xhigh atau max, permintaan dengan pengaturan ini mengembalikan error 400, jadi gunakan adaptive thinking pada tingkat tersebut: hilangkan field thinking atau kirim thinking: {"type": "adaptive"}. Lihat Menjalankan tanpa thinking di awal.
Claude Sonnet 5.5 juga mendukung mengubah effort di tengah percakapan dengan output_config per pesan, yang mempertahankan cache prompt. Dengan between_tools, effort tidak dapat diubah di tengah percakapan: output_config.effort per pesan yang berbeda dari tingkat yang berlaku mengembalikan error 400. Untuk memvariasikan effort per giliran, gunakan adaptive thinking. Lihat Prompting Claude Sonnet 5.5.
Tingkat effort yang direkomendasikan untuk Claude Sonnet 5
Claude Sonnet 5 menggunakan effort high secara default pada Claude API dan Claude Code.
- Effort high (default): Cocok untuk penalaran kompleks, coding, dan tugas agentic di mana kualitas lebih penting daripada kecepatan atau biaya.
- Effort xhigh: Untuk tugas coding dan agentic yang paling sulit. Lihat Prompting Claude Sonnet 5.
- Effort medium: Penurunan yang menghemat biaya dari default. Sebanding dengan Claude Sonnet 4.6 pada effort high.
- Effort low: Untuk beban kerja bervolume tinggi atau sensitif terhadap latensi. Cocok untuk chat dan kasus penggunaan non-coding di mana waktu penyelesaian yang lebih cepat diprioritaskan.
- Effort max: Untuk tugas yang memerlukan kemampuan tertinggi secara mutlak tanpa batasan pengeluaran token.
Tingkat effort yang direkomendasikan untuk Claude Sonnet 4.6
Sonnet 4.6 secara default menggunakan effort high. Atur effort secara eksplisit saat menggunakan Sonnet 4.6 untuk menghindari latensi yang tidak terduga:
- Effort medium (default yang direkomendasikan): Keseimbangan terbaik antara kecepatan, biaya, dan kinerja untuk sebagian besar aplikasi. Cocok untuk coding agentik, alur kerja yang banyak menggunakan alat, dan pembuatan kode.
- Effort low: Untuk beban kerja bervolume tinggi atau yang sensitif terhadap latensi. Cocok untuk chat dan kasus penggunaan non-coding di mana waktu penyelesaian yang lebih cepat diprioritaskan.
- Effort high: Untuk penalaran kompleks dan tugas di mana kualitas lebih penting daripada kecepatan atau biaya.
- Effort max: Untuk tugas yang memerlukan kemampuan tertinggi mutlak tanpa batasan pada pengeluaran token.
Tingkat effort yang direkomendasikan untuk Claude Haiku 5.5
Claude Haiku 5.5 mendukung kelima tingkat effort, dan medium adalah default di Claude API dan di Claude Code. Effort adalah kontrol utama untuk seberapa banyak model berpikir, dan bersamanya kualitas, latensi, dan biaya. Mulailah dengan medium untuk sebagian besar pekerjaan, termasuk coding agentik. Gunakan low, tingkat termurah dan tercepat, untuk chat, tugas alat singkat, dan permintaan sederhana bervolume tinggi. Dalam prompt agen yang panjang, model lebih mungkin melewatkan pencarian, berhenti lebih awal, atau melewatkan pemeriksaan pada low. Gunakan high untuk pekerjaan pengetahuan, tugas agen yang lebih panjang, dan kepatuhan instruksi yang ketat. Gunakan xhigh atau max hanya jika eval Anda menunjukkan peningkatan kualitas, dan bandingkan dengan Claude Sonnet 5.5 dalam hal kinerja, biaya, dan kecepatan. Thinking aktif secara default dan dihitung terhadap max_tokens, jadi sisakan ruang untuknya. Lihat Prompting Claude Haiku 5.5.
Untuk mendapatkan thinking yang lebih sedikit, turunkan tingkat effort. Anda juga dapat mengirim thinking: {"type": "disabled"} pada effort high atau di bawahnya. Pada xhigh atau max, ini mengembalikan error 400, jadi gunakan adaptive thinking di sana: hilangkan field thinking atau kirim thinking: {"type": "adaptive"}.
Di Claude API dan Google Cloud, Claude Haiku 5.5 juga mendukung mengubah effort di tengah percakapan dengan output_config per pesan, yang mempertahankan cache prompt. Dengan thinking: {"type": "disabled"}, effort tidak dapat diubah di tengah percakapan: output_config.effort per pesan yang berbeda dari tingkat yang berlaku mengembalikan error 400. Untuk memvariasikan effort per giliran, gunakan adaptive thinking.
Effort dengan penggunaan alat
Saat menggunakan alat, parameter effort memengaruhi baik penjelasan di sekitar pemanggilan alat maupun pemanggilan alat itu sendiri. Tingkat effort yang lebih rendah cenderung:
- Menggabungkan beberapa operasi menjadi lebih sedikit pemanggilan alat
- Melakukan lebih sedikit pemanggilan alat
- Langsung bertindak tanpa pendahuluan
- Menggunakan pesan konfirmasi ringkas setelah selesai
Tingkat effort yang lebih tinggi mungkin:
- Melakukan lebih banyak pemanggilan alat
- Menjelaskan rencana sebelum bertindak
- Memberikan ringkasan perubahan yang mendetail
- Menyertakan komentar kode yang lebih komprehensif
Effort dengan thinking
Parameter thinking mengontrol apakah Claude berpikir dalam blok thinking sebelum menjawab; parameter effort mengontrol seberapa banyak upaya yang Claude curahkan untuk keseluruhan respons, yang dalam mode adaptif mencakup seberapa sering dan seberapa dalam Claude berpikir. Jangan berikan adaptive sebagai nilai effort: adaptive adalah mode berpikir, bukan tingkat upaya.
Pada tingkat effort yang lebih tinggi, Claude lebih mudah berpikir dan berpikir lebih panjang. Dalam loop penggunaan alat, permintaan lanjutan yang hanya memproses hasil alat tetap dapat melewati thinking pada tingkat mana pun. Pada tingkat yang lebih rendah, Claude dapat melewati thinking sepenuhnya untuk masalah yang lebih sederhana. Lihat Thinking dan effort untuk panduan lengkap tentang bagaimana kedua kontrol tersebut bekerja bersama.
Pada Claude Opus 4.5, satu-satunya model khusus pemikiran diperpanjang yang mendukung effort, parameter ini bekerja berdampingan dengan budget_tokens: atur tingkat effort untuk tugas Anda, lalu atur anggaran token thinking berdasarkan seberapa dalam penalaran yang dibutuhkan tugas tersebut.
Untuk ketersediaan thinking per model, lihat tabel konfigurasi per model. Effort berfungsi dengan atau tanpa thinking. Lihat Cara kerja effort.
Mengubah effort di tengah percakapan
Anda dapat menjalankan giliran selanjutnya dari suatu percakapan pada tingkat effort yang berbeda dengan dua cara. Pada Claude Fable 5.1, Claude Mythos 5.1, Claude Opus 5.5, Claude Opus 5, Claude Sonnet 5.5, dan Claude Haiku 5.5, gunakan perubahan effort per pesan, yang mempertahankan cache prompt. Pada model lain, atur nilai tingkat atas yang baru pada permintaan berikutnya, yang memulai ulang cache.
Effort per pesan (beta)
Effort per pesan masih dalam tahap beta. Di Claude API dan Google Cloud, fitur ini tersedia di Claude Fable 5.1, Claude Mythos 5.1, Claude Opus 5.5, Claude Opus 5, Claude Sonnet 5.5, dan Claude Haiku 5.5. Di Amazon Bedrock, fitur ini tersedia di Claude Fable 5.1, Claude Mythos 5.1, dan Claude Opus 5.5. Fitur ini memerlukan header beta mid-conversation-output-config-2026-07-01. Dengan InvokeModel API Amazon Bedrock, fitur ini tersedia di Claude Fable 5.1 dan Claude Opus 5.5, dan Anda mengirim nilai tersebut dalam array anthropic_beta pada body permintaan sebagai gantinya.
Tanpa nilai beta, output_config per pesan mengembalikan error 400: messages.N.output_config: Extra inputs are not permitted, di mana N adalah indeks pesan system dalam messages. Dengan nilai beta, model tanpa effort per pesan, termasuk Claude Fable 5, mengembalikan error 400: output_config.effort requires a model that supports per-turn effort; this model does not. Di Amazon Bedrock, model-model tersebut dan Claude Opus 5 mengembalikan error Extra inputs are not permitted sebagai gantinya. Pada Claude Sonnet 5.5 dengan thinking: {"type": "between_tools"} dan pada Claude Haiku 5.5 dengan thinking: {"type": "disabled"}, effort tidak dapat diubah di tengah percakapan: output_config.effort per pesan yang berbeda dari tingkat yang berlaku mengembalikan error 400. Untuk memvariasikan effort per giliran, gunakan adaptive thinking.
Tambahkan pesan role: "system" dengan content kosong dan tingkat baru dalam output_config.effort. Tingkat baru berlaku mulai dari giliran user berikutnya dan bertahan hingga pesan selanjutnya mengubahnya. Semua yang ada sebelum pesan tersebut tidak berubah, sehingga prefiks yang di-cache tetap cocok.
Contoh berikut dimulai pada high, lalu turun ke low untuk tindak lanjut rutin:
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-fable-5-1",
max_tokens=4096,
output_config={"effort": "high"},
messages=[
{
"role": "user",
"content": "Plan a migration from SQLite to PostgreSQL in three short steps.",
},
{
"role": "assistant",
"content": "1. Export the SQLite data. 2. Create the PostgreSQL schema. 3. Import the data and verify row counts.",
},
# Pesan sistem khusus effort: level baru berlaku mulai giliran pengguna berikutnya.
{"role": "system", "content": [], "output_config": {"effort": "low"}},
{"role": "user", "content": "Summarize the plan in one sentence."},
],
betas=["mid-conversation-output-config-2026-07-01"],
)
for block in response.content:
if block.type == "text":
print(block.text)Pesan sistem yang hanya berisi effort tidak membawa teks, sehingga aturan penempatan untuk pesan sistem di tengah percakapan tidak berlaku. Pesan ini dapat muncul di mana saja dalam messages, termasuk sebagai entri pertama atau di antara giliran assistant dan giliran user berikutnya. Nilainya adalah nama tingkat (low, medium, high, xhigh, dan max).
Pada Claude Fable 5.1, utamakan bentuk ini daripada mengubah nilai tingkat atas di antara permintaan. Perubahan tingkat atas memulai ulang cache dan juga mengarahkan model dengan kurang andal: balasan sebelumnya ditulis pada tingkat sebelumnya, dan model cenderung tetap konsisten dengannya.
Effort tingkat atas pada permintaan berikutnya
output_config.effort tingkat atas berlaku untuk seluruh permintaan. Untuk menjalankan bagian percakapan selanjutnya pada tingkat yang berbeda, atur nilai baru pada permintaan berikutnya. Karena effort tingkat atas membentuk prompt yang dirender, mengubahnya di antara permintaan tidak mempertahankan prefiks yang di-cache dari giliran sebelumnya. Jika Anda mengandalkan caching prompt sepanjang sesi yang panjang dan model Anda tidak mendukung effort per pesan, pilih tingkat effort di awal dan pertahankan agar tetap konstan.
Praktik terbaik
- Atur effort secara eksplisit: API secara default menggunakan
high(mediumpada Claude Opus 5.5 dan Claude Haiku 5.5), tetapi titik awal yang tepat bergantung pada model dan beban kerja Anda. - Gunakan low untuk tugas yang sensitif terhadap kecepatan atau sederhana: Ketika latensi penting atau tugas bersifat langsung, effort low dapat secara signifikan mengurangi waktu respons dan biaya.
- Uji kasus penggunaan Anda: Dampak tingkat effort bervariasi menurut jenis tugas. Evaluasi kinerja pada kasus penggunaan spesifik Anda sebelum melakukan deployment.
- Pertimbangkan effort dinamis: Sesuaikan effort berdasarkan kompleksitas tugas. Kueri sederhana mungkin cukup dengan effort low, sementara coding agentik dan penalaran kompleks mendapat manfaat dari effort high. Lihat poin berikutnya sebelum memvariasikannya dalam satu percakapan.
- Pertahankan effort tingkat atas tetap konstan dalam percakapan yang di-cache: Mengubah nilai effort tingkat atas di antara permintaan membatalkan caching prompt, jadi variasikan di antara beban kerja alih-alih di dalam percakapan yang mengandalkan cache hit. Pada model yang mendukungnya, gunakan perubahan effort per pesan sebagai gantinya, yang mempertahankan cache. Lihat Pemikiran dan caching prompt.
Langkah selanjutnya
Berikan Claude anggaran token yang bersifat saran untuk seluruh loop agentik guna membantu model mengatur dirinya sendiri pada tugas agentik yang panjang.
Pahami adaptive thinking, di mana Claude menentukan kapan dan seberapa banyak berpikir, dan arahkan dengan effort dan prompting.
Pahami cara kerja thinking, kapan Claude berpikir secara default, dan bagaimana thinking berinteraksi dengan effort.
Compatibility
- Supported models
- Fable 5 and 5.1
- Mythos 5, 5.1, and Preview
- Opus 4.5, 4.6, 4.7, 4.8, 5, and 5.5
- Sonnet 4.6, 5, and 5.5
- Haiku 5.5
- Supported platforms
- Claude API
- Claude Platform on AWS
- Amazon Bedrock
- Google Cloud
- Microsoft Foundry
Was this page helpful?