Ketika sebuah beban kerja berpindah dari prototipe ke produksi, biaya menjadi batasan desain kelas utama. Model yang paling mumpuni bisa terlalu mahal dalam skala besar, dan model yang paling murah bisa kurang memadai dalam hal kualitas. Mengelola biaya dengan baik berarti memahami bagaimana setiap tuas biaya memengaruhi kualitas output, karena sebagian tuas mengorbankan kualitas dan sebagian tidak. Claude Platform memberi Anda kendali langsung atas tradeoff tersebut. Anda memilih model, tingkat effort, dan arsitektur untuk setiap permintaan, yang memungkinkan Anda menempatkan beban kerja hampir di mana saja pada batas biaya-terhadap-kecerdasan.
Tuas-tuas ini terdiri dari dua jenis:
Setiap tuas disertai hasil terukur dan aturan kapan tuas tersebut menguntungkan. Dalam pengukuran Anthropic, caching prompt adalah tuas terbesar dengan selisih yang jauh: caching memangkas biaya loop agen dengan faktor 2,5 hingga 3,7 pada benchmark panduan ini dan memangkas tagihan agen triase kecil sebesar 83%, atau 88% dengan tambahan pemangkasan input. Tuas multi-model lebih sempit; model kedua menguntungkan dalam dua bentuk, yaitu advisor dan orchestrator.
Cocokkan situasi Anda dengan salah satu baris.
| Situasi Anda | Lakukan ini | Di mana |
|---|---|---|
| Beban kerja apa pun, model apa pun | Aktifkan caching prompt dan pangkas token yang tidak diperlukan; keduanya gratis | Cache konteks berulang · Pangkas token |
| Biaya terlalu tinggi; kualitas baik-baik saja | Turunkan effort secara bertahap pada model Anda saat ini | Sesuaikan effort |
| Anda sedang memilih atau berganti model | Bandingkan berdasarkan biaya per tugas selesai, bukan per token | Bandingkan model |
| Kualitas belum cukup baik | Jika Anda menurunkan effort, kembalikan; jika tidak, coba tingkat berikutnya di atas dengan effort low | Sesuaikan effort · Bandingkan model |
Percobaan berakhir dengan stop_reason: max_tokens | Naikkan max_tokens; 64.000 mencakup setiap giliran yang diukur dan tidak menambah biaya per tugas yang terselesaikan | Tetapkan anggaran |
| Anda dapat memeriksa output (tes, verifier) | Jalankan semuanya dengan effort rendah dan jalankan ulang kegagalan pada default (high); pada benchmark coding yang diukur, tingkat kelulusan bertahan dengan sekitar setengah biaya | Jalankan ulang kegagalan |
| Loop agen dengan beberapa run yang sangat mahal | Tetapkan anggaran tugas (beta; saat ini tidak tersedia di Claude Sonnet 5), anggaran sesi Claude Managed Agents, dan batas pengeluaran workspace | Tetapkan anggaran |
| Model berbiaya lebih rendah hanya macet pada keputusan sulit | Tambahkan advisor frontier. Ini menguntungkan ketika harganya jauh di atas executor dan benar-benar dikonsultasikan, jadi pertama-tama hitung harga model advisor sendirian dengan effort rendah dan ukur tingkat konsultasinya | Strategi advisor |
| Pekerjaan melebihi satu jendela konteks | Delegasikan partisi ke worker yang lebih murah | Strategi orchestrator |
Hasil-hasil ini bersifat internal Anthropic (Benchmark yang dirujuk) dan bersifat arahan, bukan jaminan, jadi ukurlah pada beban kerja Anda sendiri dengan metode empat langkah.
Caching prompt, kebersihan token, pemrosesan batch, dan audit prompt terhadap model Anda saat ini semuanya menurunkan apa yang Anda bayar tanpa menurunkan kualitas output. Dua catatan berlaku: pemrosesan batch menukar latensi dengan diskonnya, dan context editing, sebuah tuas kebersihan token, berbiaya lebih besar daripada yang dihematnya pada run yang diukur di bagian ini.
Aktifkan caching prompt sebelum tuas lainnya, karena setiap giliran tugas agentik mengirim ulang seluruh percakapan yang terus bertambah: "system prompt" (prompt sistem), definisi alat, dan setiap giliran sebelumnya. Tugas 40 giliran mengirim giliran pertamanya 40 kali, sehingga biaya tugas tumbuh kira-kira sebanding dengan kuadrat jumlah giliran. Caching tidak menghentikan pengiriman ulang, tetapi setiap pengiriman ulang berbiaya sekitar sepersepuluhnya dan diproses lebih cepat: prefiks ditagih dengan tarif cache-read, sepersepuluh dari harga input, dan setiap giliran membayar tarif cache-write 1,25x hanya untuk bagian yang baru.
Di seluruh run terukur Anthropic, cache read secara rutin merupakan komponen tunggal terbesar dari biaya tugas, menjadikan caching lebih berharga daripada sebagian besar keputusan pilihan model. Anthropic menghitung harga run WideSearch1 dan DeepResearch Bench II7 dengan dan tanpa caching:

Masa hidup default cache adalah 5 menit dan giliran-giliran loop agen hanya berjarak beberapa detik, sehingga diskon berlaku untuk sebagian besar token pada setiap giliran; run yang digambarkan mencapai hit rate 81% hingga 90%. Penghematannya bervariasi menurut kedalaman episode, karena loop yang lebih pendek membaca ulang lebih sedikit, tetapi caching tetap menjadi tuas tunggal terbesar pada setiap model dan benchmark yang diukur.
Jika loop Anda menunggu manusia di antara giliran, gunakan durasi cache 1 jam. Biaya penulisannya lebih mahal (2x harga input, bukan 1,25x) tetapi terbayar pada miss pertama yang dicegah, karena sebuah miss mengirim ulang seluruh prefiks dengan harga penuh dan menulisnya lagi.
Penyiapannya hanya memerlukan sedikit pekerjaan. Caching otomatis menempatkan breakpoint untuk Anda; jika tidak, skill Claude API yang disertakan dengan Claude Code dapat menambahkan caching ke integrasi yang sudah ada dari satu prompt. Kutipan berikut menunjukkan skill tersebut menambahkannya ke harness yang menghasilkan pengukuran ini:
$ claude
> /claude-api add prompt caching to this integration
Done. Prompt caching is now wired into the harness. Two changes:
- build_system() now adds cache_control: {"type": "ephemeral"} to the
system block. Since the API renders tools -> system -> messages, this
one breakpoint caches the entire static prefix -- the full tool array
plus the system prompt.
- apply_moving_cache_breakpoints() strips any stale markers, then marks
the last content block of the two most recent user turns. The older
marker is the read point matching the prefix the previous request
cached; the newer one extends the cache for the next request.
That's 3 breakpoints total, under the limit of 4.
...Penempatan breakpoint tersebut mengikuti pola standar dalam Breakpoint cache eksplisit.
Tiga pengaturan dapat merusak cache Anda selama sebuah tugas. Mengubah effort di antara permintaan membatalkan prefiks yang di-cache, jadi ubahlah hanya di tempat Anda memang akan melakukan cache ulang, seperti pada batas compaction. Mengubah anggaran tugas di tengah jalan melakukan hal yang sama, jadi tetapkan sekali, pada permintaan pertama. Setiap pass context editing membatalkan prefiks dari titik yang dibersihkannya dan permintaan berikutnya membayar untuk melakukan cache ulang semua yang ada setelahnya, jadi bersihkan dalam beberapa batch besar daripada banyak batch kecil. Lakukan ketiga perubahan tersebut pada jeda alami, lalu pastikan cache read tidak turun; jika turun, diagnostik cache menunjukkan di mana prefiks menyimpang.
Sebagian besar permintaan agen membawa token yang tidak pernah memengaruhi jawaban. Memangkasnya tidak mengorbankan kualitas output sama sekali, meskipun tidak setiap tuas di sini menghemat uang saat diukur. Dua tempat untuk diperiksa:
Tuas-tuas ini berinteraksi dengan cache dan satu sama lain, jadi nilailah berdasarkan efek bersihnya, dan gunakan diagnostik cache untuk memastikan prefiks yang di-cache bertahan dari setiap perubahan. Anthropic mengaktifkan tuas-tuas tersebut satu per satu untuk agen triase isu yang mengerjakan 20 laporan bug nyata dengan tangkapan layar dari repositori publik (dan, untuk panel kedua, varian yang lebih panjang dari pekerjaan yang sama):

Caching melakukan hampir semua pekerjaan, dan pemangkasan membawa totalnya ke 88%. Setiap batang adalah satu run, jadi perbedaan $0,10 adalah noise; perbedaan yang ditampilkan di sini bukan. Compaction membutuhkan sesi yang cukup panjang untuk memicunya: run 20 isu tidak pernah mencapai batas bawah 50.000 token setelah inputnya dipangkas, tetapi pada varian yang lebih panjang di panel kedua, compaction terpicu sekali dan memangkas tagihan 38% lagi.
Context editing adalah satu-satunya tuas di sini yang tidak gratis. Setiap pass pembersihan menulis ulang percakapan yang di-cache, yang bekerja melawan caching prompt; pada run ini, context editing berbiaya lebih besar daripada yang dihematnya. Gunakan untuk memberi ruang di jendela konteks, dan bersihkan dalam beberapa batch besar.
Batch API memberi diskon 50% untuk setiap token permintaan, termasuk yang di-cache, dengan imbalan hasil yang tiba kapan saja dalam 24 jam. Arahkan setiap permintaan yang tidak ditunggu siapa pun melalui batch, dan pertahankan jalur interaktif untuk sisanya. Batching adalah tuas gratis terbesar kedua setelah caching untuk pekerjaan agen tanpa pengawasan: run evaluasi, backfill, dan pekerjaan terjadwal seperti run berulang dari agen triase isu pada pengukuran pemangkasan token. Batching dapat digabungkan dengan semua hal di halaman ini kecuali interaktivitas, tetapi tidak tersedia untuk sesi Claude Managed Agents, yang memang dirancang interaktif (lihat harga Claude Managed Agents).
Setiap generasi model merespons prompt secara berbeda, sehingga sebuah prompt mengakumulasi teks yang ditulis untuk model yang tidak lagi Anda gunakan. Kasus yang umum adalah instruksi yang terlalu spesifik yang ditambahkan untuk mengompensasi model lama: "verifikasi dua kali," "bersikaplah seteliti mungkin," prosedur langkah demi langkah yang wajib, atau scratchpad penalaran buatan sendiri. Model yang lebih baru mengikuti semua ini secara harfiah, menghasilkan putaran alat tambahan dan tulisan tambahan, sehingga tagihan naik tanpa peningkatan akurasi. Mengaudit prompt terhadap model yang Anda jalankan sekarang, dan lagi setiap kali Anda berganti model, adalah kemenangan gratis.
Auditnya hanya satu perintah. Skill Claude API yang disertakan dengan Claude Code memiliki perintah prompt-audit yang membaca prompt dan kode permintaan sebuah proyek dan melaporkan apa yang ditulis untuk model yang berbeda. Kutipan singkat ini menunjukkannya dijalankan terhadap prompt support-desk dan kode permintaan yang berisi pola-pola tersebut:
$ claude
> /claude-api prompt-audit
10 findings. The three that matter most:
1. budget_tokens returns a 400 on Opus 5 (support_agent.py:10). This code
does not run against its own target model. Everything else here is
quality; this one is an outage.
2. The prompt contains two live contradictions. Line 15 says confirm before
every refund, line 17 says process every eligible refund immediately.
Line 19 asks for a complete recap *and* a three-sentence maximum.
3. The reasoning scaffold and the 6-step script fight the model rather than
steer it. <scratchpad> + "reason step by step" is now a request
parameter, not prose; the mandatory 6-step procedure plus "investigate
fully even when the ticket looks simple" forces four tool calls on a
"where's my package" ticket.
...
-After any refund or escalation, verify twice before submitting: re-fetch
-the order, re-check every figure in your reply against the fresh lookup,
-and review the reply a second time for errors.
+Before submitting a refund or an escalation, re-fetch the order and confirm
+every figure in your reply matches the fresh lookup.Perintah tersebut kemudian mengusulkan editnya sebagai diff (satu hunk ditampilkan) dan mencantumkan apa yang sengaja dibiarkannya: jangka waktu refund, persyaratan nada, dan standar kualitas. Anda meninjau sebuah patch, bukan penulisan ulang.
Efeknya terukur. Pada evaluasi support-desk14, prompt yang ditulis untuk Claude Opus 4.8 berbiaya 36% lebih mahal per tiket pada Claude Opus 5 tanpa perubahan akurasi. Menjalankan audit pada prompt yang sama membuat Opus 5 lebih murah daripada versi yang tidak diaudit (sebesar 14%) dan lebih akurat (97% tiket, naik dari 92%, peningkatan di luar noise). Pada migrasi Claude Sonnet 4.6 ke Claude Sonnet 5, audit memangkas 14% dengan akurasi yang sama:

Kedua jenis teks usang memiliki biaya yang berbeda. Instruksi yang diikuti model baru terlalu harfiah memakan uang: menghapus "verifikasi dua kali" memangkas biaya per tiket Opus 5 sepertiganya, dan menghapus "bersikaplah seteliti mungkin" hampir sebanyak itu. Teks yang tidak lagi cocok dengan model justru memakan akurasi: pengaturan thinking yang sudah dipensiunkan, aturan yang saling bertentangan, dan scratchpad buatan sendiri yang berkonflik dengan thinking model itu sendiri masing-masing memulihkan 7 hingga 11 poin pada Opus 5 ketika dihapus:

Pola yang sama muncul dalam deskripsi alat dan skill, dan layak dihapus di sana juga.
Tuas-tuas ini menentukan di mana satu model berada di antara biaya dan kecerdasan: pilihan model, effort, menjalankan ulang kegagalan pada pengaturan yang lebih tinggi, serta anggaran dan batas tempat model bekerja. Mulailah dengan sweep effort pada model Anda saat ini (Sesuaikan effort). Dari biaya dan kemampuan terendah ke tertinggi, model saat ini adalah Claude Haiku 4.5, Claude Sonnet 5, Claude Opus 5, dan Claude Fable 5 (model frontier); Ikhtisar model memuat jajaran lengkap dan harganya.
Daftar harga ditulis per token, dan per token model frontier terlihat mahal: harga per token Claude Fable 5 beberapa kali lipat harga Claude Sonnet 5. Namun, Anda membayar untuk tugas yang selesai, jadi bandingkan model berdasarkan biaya per tugas selesai. Model yang lebih mumpuni menyelesaikan tugas dengan lebih sedikit pekerjaan: lebih sedikit giliran, lebih sedikit pencarian, lebih sedikit membaca ulang konteksnya sendiri, dan lebih sedikit mundur. Premi per token secara rutin tertutupi oleh melakukan lebih sedikit dari segalanya.
Anthropic mengukur ini secara langsung pada DeepResearch Bench II7, benchmark laporan riset yang cukup sulit untuk membedakan model-model tersebut:

Model frontier dengan effort low lebih akurat dan sekitar 10% lebih murah per tugas daripada model tingkat menengah, meskipun ada selisih per token. Namun, model frontier tidak selalu menang. Pada subset SWE-bench Pro3 halaman ini, yang sebagian besar sudah dijenuhkan oleh kedua model dan yang skornya tidak dapat dibandingkan dengan leaderboard publik, Claude Opus 5 sendirian menyamai Claude Fable 5 sendirian (91,7% dibandingkan 91,3%, di dalam noise antar-run) dengan sekitar 60% biayanya. Pada pekerjaan yang lebih sulit, seperti tugas DeepResearch Bench II, keunggulan Fable muncul kembali.
Untuk sebagian besar beban kerja agen, mulailah dengan Claude Opus 5: per token biayanya setengah dari Fable 5 dan 2,5 kali Sonnet 5, dan pada subset coding tersebut Opus 5 menyamai akurasi Fable. Di ujung lain, Claude Haiku 4.5 menjawab pertanyaan GPQA Diamond9 dengan sekitar sepersepuluh biaya per pertanyaan Opus 5, dengan akurasi 63% dibandingkan 92% untuk Opus, dan tertinggal jauh lebih banyak pada tugas coding panjang. Haiku cocok untuk pekerjaan bervolume tinggi dengan output yang dapat diperiksa, bukan loop agentik panjang.
Peringkatnya berbalik menurut beban kerja, dan tidak ada daftar harga yang memberi tahu Anda ke arah mana. Hitung harga setiap kandidat dalam biaya per tugas selesai pada lalu lintas Anda sendiri, termasuk Claude Opus 5 dan model frontier dengan effort yang dikurangi.
Hitung harga ekor beban kerja Anda, bukan mediannya: bandingkan model pada sepersepuluh tugas tersulit Anda, bukan tugas yang tipikal. Pada tugas tipikal setiap model terlihat serupa dan yang termurah terlihat terbaik, tetapi tagihan ditentukan oleh tugas-tugas yang gagal dikerjakan model yang lebih murah, karena tugas yang gagal tetap menagih tokennya, lalu percobaan ulangnya, lalu apa pun biaya kegagalan tersebut di hilir. Ekor juga merupakan tempat uang mengalir bahkan ketika tidak ada yang gagal. Pada run WideSearch1 20 masalah, dua masalah menanggung 43% pengeluaran:

Strategi multi-model ada untuk membelanjakan kecerdasan frontier pada ekor tersebut tanpa membayar tarif frontier untuk sisanya.
Effort adalah cara paling langsung untuk menyesuaikan model dengan tugas Anda. Parameter effort mengatur seberapa banyak thinking, pemanggilan alat, dan verifikasi diri yang dilakukan model, dan default-nya (high) cocok untuk tugas yang menuntut. Biaya berskala dengan semua aktivitas itu; akurasi hanya berskala dengan bagian yang dibutuhkan tugas Anda. Di bawah batas atas model, tingkat effort tertinggi membayar kedalaman yang tidak pernah digunakan tugas.
Pada benchmark riset dan pekerjaan pengetahuan (WideSearch1, DeepWideSearch6, BrowseComp4, dan GDPval2, semuanya dengan Claude Fable 5), kurva akurasi terhadap biaya hampir datar: low mengorbankan 1 hingga 3 poin untuk potongan sepertiga hingga setengah biaya per tugas, medium menyamai akurasi default dengan 70% hingga 85% biayanya, dan default tidak membeli apa pun yang terukur di atas medium pada keempatnya. Pada DeepWideSearch, low juga menyamai orchestrator dengan worker Claude Sonnet 5 dengan biaya 20% lebih rendah: menurunkan effort mengalahkan perubahan arsitektur.
Pengaturan yang lebih rendah juga lebih cepat, yang penting ketika latensi menjadi batasannya. Pada run ini, low memakan 4,5 menit per masalah pada DeepWideSearch, dibandingkan 7,9 menit pada default. Pada benchmark korpus, yang inputnya tidak muat dalam satu jendela konteks mana pun, Fable 5 memakan 7,9, 9,1, dan 11,4 jam per episode pada low, medium, dan default.
Coding jangka panjang adalah bentuk lainnya. Pada SWE-bench Pro3, Claude Opus 5 mengorbankan sekitar 2 poin pada medium untuk setengah biaya dan sekitar 8 poin pada low untuk seperempatnya: tradeoff yang nyata, yang diubah kembali menjadi penghematan oleh menjalankan ulang kegagalan pada effort lebih tinggi. Grafik ini memplot akurasi terhadap biaya untuk benchmark riset dan pekerjaan pengetahuan serta untuk SWE-bench Pro:

Dua konsekuensi mengikuti. Pertama, gambarlah kurva ini untuk beban kerja Anda sendiri sebelum menambahkan model kedua: dalam pengukuran internal ini, konfigurasi multi-model yang terlihat lebih murah daripada model tunggal default berbiaya lebih mahal daripada model yang sama dengan effort lebih rendah. Kedua, kurva ini adalah baseline model tunggal yang harus dikalahkan oleh strategi multi-model apa pun, sehingga langkah 2 dari mengukur pada beban kerja Anda sendiri membuat baseline di seluruh tingkat effort.
Effort yang lebih rendah memang mengorbankan akurasi pada beban kerja yang mencapai batas atas model, di mana akurasi benar-benar berskala dengan kedalaman penalaran. Pada DeepResearch Bench II7, di mana setiap laporan menghargai penalaran mendalam per subtopik, setiap langkah effort membeli sekitar 2,4 poin skor rubrik; tidak ada pemangkasan biaya gratis pada kurva itu:

Deskripsi tugas saja tidak mengungkapkan jenis beban kerja mana yang Anda miliki, jadi lakukan sweep dua atau tiga tingkat effort pada sampel lalu lintas Anda sendiri dan baca jawabannya dari kurva. Uji setiap tingkat dalam sesi terpisah: mengubah effort di tengah sesi membatalkan cache (lihat Cache konteks berulang) dan mendistorsi perbandingan. Untuk detail parameter, lihat Effort.
Ketika hasil sebuah tugas dapat diperiksa, kebijakan termurah pada kurva effort bukanlah pengaturan tetap: jalankan setiap tugas pada pengaturan rendah dan jalankan ulang hanya kegagalannya pada pengaturan yang lebih tinggi.
Anthropic menghitung kebijakan ini tugas demi tugas dari run effort pada subset SWE-bench Pro3 di Sesuaikan effort. Dengan Claude Opus 5 pada low, 16% tugas gagal; dengan tugas-tugas tersebut dijalankan ulang pada default, sekitar 93% lulus dengan biaya sekitar $0,70 masing-masing, dibandingkan 91,7% dengan $1,39 jika menjalankan semuanya pada default: tingkat kelulusan yang sama dengan setengah biaya, termasuk percobaan murah yang gagal. Memulai dari medium justru menyelesaikan sekitar 94% dengan sekitar $0,95. Sebagian besar peningkatan kecil itu berasal dari percobaan kedua (menjalankan ulang kegagalan default sendiri pada default menghasilkan skor yang kira-kira sama, dengan biaya lebih besar), jadi gunakan kebijakan ini untuk penghematannya, bukan peningkatannya:

Dua syarat berlaku. Pertama, Anda membutuhkan sinyal kegagalan (di sini, tes benchmark itu sendiri); pemeriksa yang meloloskan pekerjaan buruk membiarkan kegagalan tersebut lewat. Kedua, setiap kegagalan pass pertama memakan waktu nyata setara dua run, sehingga penghematannya dibayar dengan latensi pada kegagalan.
Sebagian besar run tugas agentik murah, tetapi sebagian kecil menghabiskan berkali-kali lipat biaya median untuk pencarian, verifikasi ulang, dan pengujian berlebihan. Anggaran tugas menargetkan ekor tersebut. Model melihat hitung mundur token langsung untuk seluruh tugas dan mengatur dirinya sendiri, memangkas pencarian bernilai rendah, melewatkan verifikasi yang berlebihan, dan menyelesaikan pekerjaan alih-alih berputar-putar.
Anthropic mengukur tingkat kelulusan dan biaya per tugas pada SWE-bench Pro3 dengan Claude Fable 5 seiring anggaran diperketat:

Anggaran yang longgar mengorbankan sekitar 2,7 poin tingkat kelulusan untuk penghematan biaya 18%, dan anggaran terketat yang diizinkan mengorbankan 4,4 poin untuk penghematan 47%. Anggaran membeli efisiensi di sini, bukan akurasi.
Tiga kontrol melakukan tiga pekerjaan berbeda. Anggaran tugas menghemat uang, karena model melihatnya. max_tokens adalah batas pengaman yang tidak menghemat apa pun. Pada Claude Managed Agents, anggaran sesi adalah penghentian keras dalam dolar di balik keduanya. Tetapkan ketiganya: anggaran tugas, max_tokens yang tinggi, dan batas sesi untuk run yang tidak pernah Anda inginkan muncul di tagihan, dengan batas pengeluaran workspace sebagai pengaman terakhir.
task-budgets-2026-03-13) pada Claude Opus 5, Claude Fable 5, Claude Opus 4.8, dan Claude Opus 4.7, tetapi tidak pada Claude Sonnet 5; periksa tabel dukungan terlebih dahulu. Mulailah di dekat penggunaan token persentil ke-90 loop Anda, lalu perketat (Memilih anggaran menunjukkan cara mengumpulkan distribusi tersebut). Anggaran di bawah batas bawah 20.000 token saat ini ditolak, dan anggaran yang sangat ketat dapat menghasilkan perilaku mirip penolakan. Tetapkan anggaran sekali, pada permintaan pertama, karena perubahan di tengah tugas membatalkan cache. Anggaran bersifat anjuran, mengarahkan model alih-alih menghentikannya, jadi verifikasi kepatuhannya pada beban kerja Anda.max_tokens membatasi satu respons, tanpa terlihat oleh model, sehingga menurunkannya tidak membuat model berhemat. Giliran yang membutuhkan ruang tersebut dibuang dan tetap ditagih. Pada benchmark tugas repositori internal12, batas 16.384 token mengakhiri 15% percobaan Claude Opus 5 dan sepertiga percobaan Claude Fable 5, tidak satu pun terselesaikan. Run yang dibatasi menghabiskan lebih sedikit per percobaan tetapi membeli penyelesaian yang secara proporsional lebih sedikit, sehingga biaya per tugas terselesaikan sama dengan pada 64.000. Pada pengaturan itu tidak ada yang terpotong, dan Fable menyelesaikan 54,6% tugas alih-alih 36,6% pada masalah yang dinilai oleh kedua run (pada potongan terpisah dari subset SWE-bench Pro3, yang dijelaskan dalam referensi 12, 92% alih-alih 90%). Mencoba ulang percobaan yang dibatasi hanya menambah biaya: pada batas yang sama percobaan tersebut tidak pernah berhasil, dan pada batas yang lebih tinggi Anda juga membayar percobaan yang terbuang. Tetapkan max_tokens ke 64.000 untuk pekerjaan agentik (128.000, maksimumnya, pada effort xhigh atau max), stream respons sebesar itu, perlakukan stop_reason: max_tokens sebagai kegagalan, dan hemat uang dengan effort dan anggaran tugas, yang dapat dilihat model.stop_reason: budget_reached; menaikkan anggaran melanjutkannya. Anggaran ini ditegakkan oleh platform, berfungsi pada model apa pun yang memiliki harga daftar (termasuk Claude Sonnet 5), dan dapat digabungkan dengan anggaran tugas yang bersifat anjuran. Deployment menerapkan field yang sama ke setiap run.Grafik pertama dari dua grafik max_tokens memplot biaya per percobaan dan per tugas terselesaikan pada setiap batas:

Grafik kedua memplot panjang output per giliran terhadap batas-batas tersebut:

Arsitektur multi-model cocok untuk beban kerja yang kompleksitas tugasnya cukup bervariasi sehingga langkah-langkah yang berbeda paling baik dilayani oleh model yang berbeda. Ketika lalu lintas Anda mencampur pekerjaan rutin yang ditangani model lebih kecil dengan andal dengan langkah-langkah lebih sulit yang membutuhkan kemampuan frontier, membagi pekerjaan menjaga kecerdasan frontier di tempat yang penting sementara sebagian besar token ditagih dengan tarif model lebih kecil. Ketika beban kerja tidak memiliki campuran itu, karena kesulitannya seragam atau merupakan satu rantai yang saling bergantung, satu model yang disetel dengan baik biasanya merupakan pilihan yang lebih baik. Setiap bagian strategi memberikan aturan untuk membedakan kedua kasus tersebut.
Dua strategi mencakup sebagian besar beban kerja, dan keduanya berbeda dalam model mana yang memegang loop utama:
| Strategi | Alur kendali | Peran model frontier | Cocok untuk | Biaya frontier berskala dengan |
|---|---|---|---|---|
| Advisor | Model lebih kecil menjalankan loop, mengeskalasi sesuai permintaan | Dikonsultasikan untuk rencana dan koreksi | Pekerjaan serial yang sulit di beberapa titik, seperti banyak giliran agen coding di antara beberapa keputusan nyata | Seberapa sering executor macet |
| Orchestrator | Model frontier menjalankan loop, mendelegasikan pekerjaan massal | Merencanakan, mengirim tugas, dan mensintesis | Pekerjaan yang menyebar ke file, dokumen, atau kasus yang benar-benar independen, terutama yang lebih dari satu jendela konteks | Seberapa sulit bagian-bagiannya dikoordinasikan |
Dalam strategi advisor (penasihat), model executor (pelaksana) berbiaya lebih rendah menjalankan loop agen dan melakukan sebagian besar giliran. Ketika model tersebut menemui keputusan yang membutuhkan penilaian lebih mendalam, seperti memilih pendekatan atau memulihkan diri dari kegagalan, ia memanggil model advisor dengan kecerdasan lebih tinggi untuk mendapatkan panduan strategis, lalu melanjutkan. Sebagian besar token ditagih dengan tarif executor, dan hanya konsultasi sesekali yang ditagih dengan tarif advisor.
Untuk menggunakannya, tambahkan alat advisor ke permintaan Anda. Fitur beta ini menjalankan seluruh strategi di sisi server dalam satu permintaan /v1/messages: executor mengeluarkan panggilan alat, Anthropic menjalankan inferensi advisor, dan executor melanjutkan dengan saran tersebut; Anda tidak perlu menulis kode orkestrasi apa pun. Di Claude Managed Agents, berikan sesi sebuah advisor dengan menambahkan entri advisor ke daftar multiagent milik agen; thread utama sesi berkonsultasi dengannya dengan cara yang sama. Claude Code juga mendukungnya; lihat mengeskalasikan keputusan sulit dengan alat advisor.

Apa yang menentukan hasilnya. Advisor hanya melihat tugas melalui panggilan executor, sehingga dua hal menentukan seberapa besar bantuannya.
Yang pertama adalah kesenjangan antara kedua model. Advisor hanya dapat menyerahkan kemampuan yang tidak dimiliki executor: pada GPQA Diamond9 executor Claude Haiku 4.5 memperoleh banyak sekali dari advisor Claude Opus 5, executor Claude Sonnet 5 memperoleh beberapa poin, dan executor frontier hampir tidak memperoleh apa-apa.
Yang kedua, dan yang rapuh, adalah apakah executor benar-benar bertanya (tingkat konsultasi atau consult rate). Executor dengan effort rendah dapat berhenti menyadari bahwa ia sedang buntu: pasangan yang berkonsultasi pada sebagian besar tugas dengan effort default dapat turun menjadi hampir tidak berkonsultasi sama sekali ketika effort diturunkan, dan kemudian mendapat skor di bawah executor sendirian. Tingkat ini juga bervariasi menurut tugas: pada DeepSWE10 executor Sonnet 5 dengan effort rendah terus bertanya dan memperoleh 23 poin; pada SWE-bench Pro3 executor yang sama berhenti bertanya. Ketika executor memang bertanya, ia mencapai sebagian besar jalannya. Di seluruh pasangan dalam bagan berikut, advisor menutup 60% hingga 90% kesenjangan terhadap model yang lebih kuat sementara model tersebut hanya dibayar untuk konsultasi, yang memungkinkan kasus-kasus penghematan biaya:

Tingkat konsultasi merespons prompting. Dengan hanya deskripsi bawaan alat, executor terlalu jarang memanggil, terutama pada pekerjaan coding, sehingga dokumentasi alat advisor memberikan prompt sistem yang meminta satu panggilan sebelum pekerjaan substantif dan satu sebelum menyelesaikan, sekitar dua hingga tiga panggilan per tugas. Pasangan coding yang diukur berikutnya berjalan dengan irama tersebut, sekitar dua konsultasi pada setiap tugas. Halaman itu juga membahas cara mendorong executor yang terlalu jarang memanggil dan membatasi panggilan di sisi klien untuk membatasi biaya. Jadi perhatikan tingkat konsultasi: minta melalui prompt, ukur, dan pulihkan effort executor jika tingkatnya anjlok.
Kapan menguntungkan dari sisi biaya. Advisor menghemat uang ketika beberapa konsultasi singkat, yang ditagih dengan tarif advisor, menggantikan menjalankan model advisor untuk seluruh tugas. Ini bekerja paling baik ketika model advisor dihargai jauh di atas model executor, sehingga konfigurasi yang paling hemat biaya adalah advisor frontier di atas executor tingkat menengah. Sebuah pasangan dapat bertahan bahkan di puncak rentang, karena saran juga menghemat token executor: executor yang diberi tahu pendekatan yang tepat menjelajahi lebih sedikit jalan buntu, yang dapat menutupi biaya konsultasi.
Pada benchmark agentic-coding internal11, yang dijalankan dengan agen API biasa, executor Claude Opus 5 dengan advisor Claude Fable 5 adalah konfigurasi paling akurat yang diukur: 85,7% percobaan terselesaikan dengan biaya $8,40 per percobaan. Konfigurasi ini berada di atas garis yang melalui pengaturan effort masing-masing model sendiri, tetapi hanya satu atau dua poin di atas yang terbaik di antaranya (Opus sendirian pada pengaturan default, 84,4% dengan biaya $8,50, dan Fable sendirian pada medium, 83,4% dengan biaya $8,20), yang tidak dapat dipisahkan dari noise oleh satu kali run. Fable sendirian pada effort medium mencapai akurasi yang kira-kira sama dengan pasangan tersebut (83,4% dibandingkan dengan 85,7%) dengan biaya yang kira-kira sama ($8,20 dibandingkan dengan $8,40 per percobaan):

Pengukuran sebelumnya melalui mode advisor Claude Code menghasilkan urutan yang sama. Bacalah hasil ini sebagai bentuk untuk diuji pada beban kerja Anda, bukan sebagai penghematan: di puncak rentang, advisor membeli sedikit akurasi dengan harga frontier, dan kasus penghematan biaya dimiliki oleh pasangan dengan kesenjangan kemampuan yang lebih lebar, seperti kasus pembacaan bagan berikut. Biaya latensinya adalah konsultasi itu sendiri: sekitar dua panggilan model frontier tambahan per tugas pada benchmark ini, masing-masing berada di jalur kritis tugas.
Kapan menguntungkan dibandingkan menaikkan effort. Ketika kesenjangan kemampuan lebih lebar dan akurasi beban kerja merespons effort, executor dengan effort rendah yang berkonsultasi dengan advisor dapat menjadi peningkatan yang lebih murah daripada menaikkan effort executor itu sendiri, karena advisor hanya dibayar pada tugas yang membutuhkannya.
Pada Chartography13, benchmark pembacaan bagan publik yang dijalankan di Claude Managed Agents dengan advisor-nya, executor Claude Opus 5 pada effort low dengan advisor Claude Fable 5 mendapat skor 67,5 dengan biaya $0,60 per tugas. Itu berada di atas garis yang melalui pengaturan effort masing-masing model sendiri (Opus sendirian naik dari 49 ke 75 antara low dan medium dengan biaya $0,38 hingga $0,94), meskipun pengaturan medium dan default milik executor sendiri masih memegang skor tertinggi, dengan harga 1,6 dan 3,3 kali lipat:

Executor dengan effort rendah berkonsultasi dengan advisor pada 86% tugas, kondisi yang gagal dipenuhi oleh pasangan SWE-bench Pro. Ukur tingkat konsultasi dalam loop agen Anda sebelum mengandalkan konfigurasi ini.
Apa pun pasangannya, pertama-tama hitung harga model advisor sendirian pada effort rendah; itulah baseline yang harus dikalahkan. Periksa ulang pada setiap rilis model, karena rilis menggeser baik kesenjangan kemampuan maupun rasio harga.
Kapan cocok. Strategi advisor cocok untuk beban kerja di mana giliran sebagian besar bersifat mekanis tetapi rencana yang sangat baik itu penting: agen coding, computer use, dan pipeline riset multilangkah. Strategi ini kurang cocok ketika setiap giliran benar-benar membutuhkan kemampuan frontier, ketika tidak ada yang perlu direncanakan (tanya jawab satu giliran), atau ketika executor Anda sudah mendekati kemampuan advisor.
Dalam strategi orchestrator (orkestrator), model frontier memegang loop. Model ini menguraikan tugas, mengirimkan subtugas ke model worker (pekerja) berbiaya lebih rendah, dan menggabungkan hasilnya. Transkrip orchestrator sendiri tetap pendek karena worker menyerap eksplorasi yang padat token, sehingga sebagian besar token ditagih dengan tarif worker sementara rencana dan sintesis tetap berasal dari model frontier.
Untuk membangunnya, gunakan orkestrasi multiagen di Claude Managed Agents: konfigurasikan agen koordinator (orchestrator) dan daftar agen worker, masing-masing dengan modelnya sendiri. Untuk contoh kerja lengkap dengan koordinator Claude Fable 5 dan worker Claude Sonnet 5, lihat resep Claude Cookbook Coordinator pattern: big models for planning, small models for execution.

Pola ini menghemat waktu nyata (wall-clock) ketika worker dapat berjalan secara paralel: pada benchmark korpus8, satu episode memakan waktu sedikit di atas 2 jam dengan koordinator menjalankan batas terdokumentasi platform sebanyak 25 worker bersamaan, dibandingkan dengan 11,4 jam secara solo. Pola ini menghemat uang hanya dalam dua situasi yang diukur. Pada pekerjaan yang dapat ditangani satu model sendirian, model yang sama pada effort lebih rendah selalu lebih murah.
Kasus 1: asuransi terhadap ekor biaya pada pekerjaan rutin. Model frontier yang berjalan sendirian sesekali berputar-putar pada masalah rutin yang biasanya dapat diselesaikannya. Karena Anda tidak dapat mengetahui sebelumnya mana yang akan demikian, beberapa run seperti itu mendominasi tagihan. Koordinator yang menyerahkan pekerjaan rutin ke worker berbiaya lebih rendah membatasi ekor tersebut, karena setiap putaran berlebih kini terjadi dengan tarif worker.
Anthropic mengukur ini pada potongan BrowseComp4 yang sengaja dibuat mudah (10 masalah yang dapat diselesaikan model solo secara andal; 50 run terdelegasi dan 70 run solo). Koordinator Claude Fable 5 dengan satu worker Claude Sonnet 5 berbiaya sedikit di bawah setengah dari Fable sendirian secara rata-rata dan sekitar sepertiga pada persentil ke-90 ($12 dibandingkan dengan $33), dan satu run termahal model solo, seharga $84, juga salah:

Delegasi menguntungkan pada bagian pekerjaan yang rutin dan biasanya dapat diselesaikan, kebalikan dari intuisi bahwa worker adalah untuk masalah sulit. Pada set BrowseComp lengkap yang lebih sulit, ekonominya berbalik. Jika lalu lintas Anda memiliki ekor biaya panjang pada tugas rutin, inilah kasus orchestrator yang harus diukur pertama kali.
Kasus 2: pekerjaan yang lebih besar dari satu jendela konteks. Model solo harus mengerjakan input sebesar itu secara serial, satu "context window" (jendela konteks) pada satu waktu, membayar untuk membaca ulang statusnya sendiri pada setiap lintasan. Worker masing-masing membaca partisinya sendiri, secara paralel dan dengan tarif worker. Pekerjaan padat-baca yang masih muat dalam satu jendela konteks adalah masalah pemilihan model, bukan masalah delegasi: dari sisi biaya pembacaan saja, orchestrator unggul hanya ketika tidak ada satu konteks pun yang dapat menampung pekerjaan tersebut.
Anthropic membangun benchmark untuk kasus ini8: korpus 21,6 juta token dari 14 paket Python publik dengan 130 cacat yang ditanam, terlalu besar untuk jendela konteks mana pun. Menurunkan effort tidak dapat membantu, karena tagihannya adalah pembacaan korpus itu sendiri: Claude Fable 5 solo berbiaya $720 hingga $764 per episode pada setiap pengaturan effort, dan hanya akurasinya yang bergerak. Konfigurasi koordinator berbiaya lebih dari 60% lebih rendah daripada pengaturan mana pun tersebut dan mendapat skor 2 hingga 6 poin di bawah Fable pada medium atau default, sambil mengalahkan baseline Claude Sonnet 5 solo secara telak:

Akuntansi token menunjukkan alasannya. Kedua tagihan sebagian besar adalah pembacaan korpus yang dilayani dari cache: konfigurasi koordinator membaca sekitar 570 juta token cache per episode, hampir tiga kali lipat dari sekitar 200 juta milik model solo, dan tetap berbiaya kurang dari setengahnya, karena pembacaannya ditagih dengan tarif cache-read Claude Sonnet 5 alih-alih Claude Fable 5. Fable 5 pada effort default masih memegang akurasi puncak, dengan biaya 2,8 kali lipat konfigurasi koordinator, sehingga delegasi di sini membeli sebagian besar akurasi, bukan seluruhnya.
Kapan delegasi tidak menguntungkan. Orchestrator membeli sesuatu hanya ketika ada pekerjaan massal untuk diserahkan: banyak bagian independen, idealnya terlalu banyak untuk satu jendela konteks. Ketika pekerjaan berupa satu rantai yang saling bergantung, atau muat dalam satu konteks, orchestrator membayar untuk rencana, penyerahan, dan penggabungan yang didapat satu model secara gratis. Dalam setiap kasus seperti itu yang diukur, model koordinator sendirian pada effort lebih rendah unggul.
BrowseComp4 menunjukkan batasnya di dalam satu benchmark. Delegasi menguntungkan pada potongan rutin dan kalah pada set lengkap yang lebih sulit, di mana model frontier sendirian mencapai akurasi konfigurasi koordinator dengan biaya 22% hingga 30% lebih rendah. Pekerjaan eksternal independen melaporkan pola yang sama5. Jika pekerjaan berupa satu rantai, muat dalam satu konteks tanpa ekor biaya panjang, atau satu model pada effort lebih rendah sudah memenuhi standar Anda, jangan bangun orchestrator.
Sebagian besar kasus bermuara pada satu pertanyaan: apakah pekerjaan terbagi menjadi bagian-bagian independen, atau merupakan satu jawaban yang dicapai melalui rantai langkah yang saling bergantung? Tabel strategi memetakan kedua jawaban tersebut ke kedua strategi.
Jika Anda tidak yakin, jangan bangun apa pun dulu:
Hasil multi-model di halaman ini dinilai terhadap model yang sama pada effort lebih rendah dan terhadap model satu tingkat di bawahnya yang berjalan sendirian. Itulah perbandingan yang harus dijalankan pada beban kerja Anda sendiri, dan alasan mengapa langkah pertama adalah sapuan effort.
Ketika Anda memang menambahkan advisor, itu berupa definisi alat, bukan perancangan ulang arsitektur.
Angka-angka di halaman ini berasal dari Juli dan Agustus 2026, dengan harga daftar pada saat itu, dan akan bergeser seiring perubahan model dan harga. Tingkat eskalasi Anda, seberapa bersih tugas terbagi, dan panjang transkrip juga menggesernya. Metodenya tetap sama:
usage setiap respons dengan tarifnya masing-masing, dijumlahkan di seluruh permintaan tugas (Usage and Cost API melaporkan agregatnya).Contoh berikut menghitung biaya langkah 1 untuk satu permintaan dengan harga daftar Claude Opus 5:
# Harga per juta token dari halaman harga; ubah dua nilai ini untuk model lain.
INPUT_PER_MTOK = 5.00 # Claude Opus 5
OUTPUT_PER_MTOK = 25.00
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-opus-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello, Claude"}],
)
usage = response.usage
cost = (
usage.input_tokens * INPUT_PER_MTOK
# Penulisan cache ditagih 1,25x harga input (cache 5 menit); pembacaan cache 0,1x.
+ (usage.cache_creation_input_tokens or 0) * INPUT_PER_MTOK * 1.25
+ (usage.cache_read_input_tokens or 0) * INPUT_PER_MTOK * 0.10
+ usage.output_tokens * OUTPUT_PER_MTOK
) / 1_000_000
print(f"Request cost: ${cost:.6f}")Dalam loop agen, komponen cache-read biasanya yang terbesar dari keempatnya; jika tidak, periksa apakah caching aktif. Ketika alat advisor atau compaction diaktifkan, sebagian token hanya dilaporkan dalam usage.iterations dan tidak dalam total tingkat atas, jadi jumlahkan usage.iterations sebagai gantinya, dengan menghitung harga entri advisor_message pada tarif model advisor.
Tabel berikut mencantumkan tuas-tuas dalam urutan untuk dicoba:
| Tuas | Penghematan dalam run ini | Biaya kualitas | Latensi | Di mana |
|---|---|---|---|---|
| Caching prompt | Biaya terpangkas dengan faktor 2,5 hingga 3,7 pada loop agen; 83% pada run triase | Tidak ada | Lebih cepat | Cache konteks berulang |
| Pemangkasan input | Tambahan 5 poin persentase pada run triase | Tidak ada | Netral | Pangkas token input dan konteks |
| Compaction | 38% pada run triase panjang; tidak ada pada loop pendek | Tidak ada yang terukur | Netral | Pangkas token input dan konteks |
| Batch API | 50% | Tidak ada | Hasil dalam 24 jam | Batch pekerjaan yang bisa menunggu |
| Audit prompt terhadap model saat ini | 14% pada kedua migrasi yang diukur | Tidak ada; peningkatan pada salah satunya | Lebih cepat (lebih sedikit putaran alat) | Audit prompt terhadap model saat ini |
| Effort lebih rendah | Pekerjaan pengetahuan: medium 15% hingga 30%, low sepertiga hingga setengah; coding panjang: medium sekitar setengah, low sekitar tiga perempat | 1 hingga 3 poin pada pekerjaan pengetahuan, 2 hingga 8 pada coding panjang | Lebih cepat | Setel effort |
| Jalankan ulang kegagalan | Sekitar setengah, pada tingkat kelulusan yang sama | Tidak ada | Dua run pada tugas yang gagal | Jalankan ulang kegagalan pada effort lebih tinggi |
| Anggaran tugas | 18% hingga 47% | 3 hingga 4 poin | Lebih cepat | Tetapkan anggaran dan batas output |
Menaikkan max_tokens | Tidak ada per tugas terselesaikan, tetapi lebih banyak tugas terselesaikan | Peningkatan 2 hingga 18 poin | Netral | Tetapkan anggaran dan batas output |
| Advisor | Bergantung pada kesenjangan kemampuan dan tingkat konsultasi; pasangan pembacaan bagan mendapat skor di atas kurva effort kedua model, pasangan coding hanya sedikit | Peningkatan kecil | Sekitar dua panggilan tambahan per tugas | Strategi advisor |
| Orchestrator | Lebih dari 60% di bawah model frontier di luar satu jendela konteks; sekitar setengah pada ekor rutin | 2 hingga 6 poin di bawah model frontier | Jauh lebih cepat pada input besar | Strategi orchestrator |
Semua pengukuran adalah run internal Anthropic atas benchmark-benchmark ini. Kecuali disebutkan lain, biaya dalam USD dengan harga daftar Agustus 2026; angka Claude Sonnet 5 menggunakan $2 dan $10 per juta token input dan output. Bagan berlabel "notional USD" menghitung harga jumlah token setiap permintaan pada tarif tersebut alih-alih melaporkan faktur.
low terlebih dahulu, lalu default pada kegagalannya, menyelesaikan 92,5% hingga 93,6% di seluruh pasangan run dengan biaya sekitar $0,70; medium terlebih dahulu, 93,8% hingga 94,2% dengan biaya sekitar $0,95; default dijalankan ulang pada kegagalannya sendiri, 94,0% dengan biaya $1,58; semuanya pada default, 90,9% hingga 92,5% dengan biaya $1,39. Pasangan executor Claude Sonnet 5 pada bagan advisor berasal dari seri Agustus 2026 yang sama pada subset ini: pasangan Sonnet-plus-Opus dijalankan dua kali (satu run dan satu replikasi persis) dan pasangan effort rendah satu kali; angka anggaran tugas adalah satu run per anggaran pada subset yang sama. Angka Claude Fable 5 dalam Bandingkan model adalah run tunggal Juli 2026, yang juga merupakan baseline tanpa anggaran pada bagan anggaran tugas; setiap run beranggaran menyelesaikan semua 482 masalah tanpa kesalahan harness.low dan medium; pasangan rata-rata sekitar dua konsultasi advisor per percobaan; biaya adalah per percobaan. Angka Claude Code adalah run Juli 2026 atas tugas yang sama, satu run per konfigurasi, biaya perkiraan.Kemenangan gratis terbesar di halaman ini: penyiapan, masa berlaku, dan diagnostik.
Tukar kecerdasan dengan latensi dan biaya dalam satu model.
Evaluasi kemampuan, kecepatan, dan biaya di seluruh keluarga model Claude.
Berikan loop agen hitung mundur token yang mereka atur sendiri.
Tetapkan batas dolar yang tegas pada sesi Managed Agents.
Lihat harga per token terkini untuk setiap model Claude.
Terapkan tuas-tuas ini satu per satu pada agen yang berfungsi dalam notebook yang dapat dijalankan, dengan biaya per tugas setelah setiap langkah.
Tonton panduan langkah demi langkah tentang Claude Fable 5 serta pola advisor dan orchestrator.
Was this page helpful?