Claude Platform Docs
Referensi APIDukungan & konfigurasi

Batas laju

Untuk memitigasi penyalahgunaan dan mengelola kapasitas pada API, terdapat batasan mengenai seberapa banyak sebuah organisasi dapat menggunakan Claude API.

Ada dua jenis batas:

  1. Batas pengeluaran ("spend limits") menetapkan biaya bulanan maksimum yang dapat dikeluarkan sebuah organisasi untuk penggunaan API.
  2. Batas laju ("rate limits") menetapkan jumlah maksimum permintaan API yang dapat dibuat sebuah organisasi dalam periode waktu tertentu.

API memberlakukan batas yang dikonfigurasi oleh layanan di tingkat organisasi, tetapi Anda juga dapat menetapkan batas yang dapat dikonfigurasi pengguna untuk workspace organisasi Anda.

Tentang batas laju

  • Batas dirancang untuk mencegah penyalahgunaan API, sekaligus meminimalkan dampak pada pola penggunaan pelanggan yang umum.
  • Batas ditentukan berdasarkan tingkat penggunaan ("usage tier"). Organisasi ditempatkan pada suatu tingkat secara otomatis berdasarkan riwayat penggunaan dan status akun, serta dapat berpindah ke tingkat yang lebih tinggi seiring waktu saat mereka menggunakan API.
  • Organisasi baru dan organisasi dengan riwayat penggunaan terbatas mungkin memulai di tingkat Evaluation, dengan batas di bawah batas standar yang ditampilkan di halaman ini selagi riwayat akun dibangun. Batas awal ini merupakan bagian dari cara Anthropic mencegah penipuan dan penyalahgunaan, dan batas tersebut meningkat secara otomatis seiring organisasi Anda membangun riwayat penggunaan.
  • Batas ditetapkan di tingkat organisasi. Anda dapat melihat tingkat dan batas organisasi Anda saat ini di halaman Rate limits di Claude Console.
  • Anda mungkin mencapai batas laju dalam interval waktu yang lebih pendek. Misalnya, laju 60 permintaan per menit (RPM) mungkin diberlakukan sebagai 1 permintaan per detik. Lonjakan permintaan singkat dapat melampaui batas dan memicu error batas laju.
  • Batas berikut adalah batas standar untuk setiap tingkat. Jika Anda memerlukan batas yang lebih tinggi, lihat Meminta batas yang lebih tinggi.
  • API menggunakan algoritma token bucket untuk melakukan pembatasan laju. Ini berarti kapasitas Anda terus diisi ulang hingga batas maksimum Anda, bukan direset pada interval tetap.
  • Semua batas yang dijelaskan di sini mewakili penggunaan maksimum yang diizinkan, bukan minimum yang dijamin. Batas ini dimaksudkan untuk mengurangi pengeluaran berlebih yang tidak disengaja dan memastikan distribusi sumber daya yang adil di antara pengguna.

Batas pengeluaran

Masing-masing tingkat Start, Build, dan Scale memiliki batas pengeluaran bulanan ("monthly spend cap"), yaitu jumlah maksimum yang dapat dibelanjakan organisasi Anda pada API setiap bulan kalender. Anda dapat melihat batas pengeluaran bulanan organisasi Anda dan menetapkan batas Anda sendiri di halaman Billing.

Tingkat penggunaanBatas pengeluaran bulanan
Start$500 USD
Build$1.000 USD
Scale$200.000 USD

Organisasi pada tingkat Custom tidak memiliki batas pengeluaran bulanan; batasnya diatur bersama tim akun mereka.

Mencapai batas pengeluaran Anda

Setelah Anda mencapai batas pengeluaran tingkat Anda, penggunaan API dijeda hingga pukul 00:00 UTC pada hari pertama bulan berikutnya, kecuali Anda meminta batas yang lebih tinggi lebih awal. Selama penggunaan dijeda, permintaan API mengembalikan HTTP 429:

{
  "type": "error",
  "error": {
    "type": "rate_limit_error",
    "message": "You have reached your API usage limits: your organization has crossed its monthly API usage threshold, set based on your organization's API tier. You will regain access on 2026-09-01 at 00:00 UTC.",
    "details": { "error_code": "enforced_spend_limit_reached" }
  },
  "request_id": "req_018EeWyXxfu5pfWkrYcMdjWG"
}
  • Tipe error-nya adalah rate_limit_error, sama seperti untuk batas laju, tetapi responsnya tidak memiliki header retry-after. Percobaan ulang, termasuk percobaan ulang otomatis dari SDK, akan gagal hingga akses dilanjutkan.
  • Pada Messages API, error.details.error_code bernilai enforced_spend_limit_reached. Gunakan nilai ini untuk membedakan respons ini dari batas laju.
  • Berpindah ke tingkat yang lebih tinggi akan memulihkan akses; lihat Meminta batas yang lebih tinggi.

Menetapkan batas pengeluaran Anda sendiri

Anda juga dapat menetapkan batas pengeluaran Anda sendiri di bawah batas tingkat Anda untuk mengendalikan biaya:

  1. Buka halaman Billing

    Buka Settings > Billing di Claude Console.

  2. Buka editor batas pengeluaran

    Di bagian Spend limits, klik Adjust limit (atau Set limit jika belum ada batas yang ditetapkan).

  3. Sesuaikan batas pengeluaran Anda

    Masukkan nilai baru. Batas pengeluaran Anda tidak dapat melebihi batas tingkat Anda saat ini.

Ketika penggunaan mencapai batas pengeluaran yang Anda tetapkan, permintaan mengembalikan HTTP 400 dengan tipe error invalid_request_error. Pesannya diawali dengan You have reached your specified API usage limits, atau You have reached your specified workspace API usage limits untuk batas workspace, dan menyatakan kapan akses dilanjutkan. Naikkan atau hapus batas tersebut untuk memulihkan akses lebih cepat.

Batas pada workspace Claude Code diperiksa secara terpisah: permintaan Claude Code yang melampaui batas workspace tersebut dapat menerima 429 yang membawa header retry-after.

Batas laju

Batas laju untuk Messages API diukur dalam permintaan per menit (RPM), token input per menit (ITPM), dan token output per menit (OTPM) untuk setiap kelas model. Jika Anda melampaui salah satu batas laju, Anda akan mendapatkan error 429 yang menjelaskan batas laju mana yang terlampaui, beserta header retry-after yang menunjukkan berapa lama harus menunggu.

ITPM yang sadar cache

Banyak penyedia API menggunakan batas gabungan "tokens per minute" (token per menit), atau TPM, yang mungkin mencakup semua token, baik yang di-cache maupun tidak, input maupun output. Untuk sebagian besar model Claude, hanya token input yang tidak di-cache yang dihitung terhadap batas laju ITPM Anda. Ini adalah keunggulan utama yang membuat batas laju secara efektif lebih tinggi daripada yang terlihat pada awalnya.

Batas laju ITPM diestimasi di awal setiap permintaan, dan estimasi tersebut disesuaikan selama permintaan berlangsung untuk mencerminkan jumlah token input aktual yang digunakan.

Berikut yang dihitung terhadap ITPM:

  • input_tokens (token setelah breakpoint cache terakhir) ✓ Dihitung terhadap ITPM
  • cache_creation_input_tokens (token yang sedang ditulis ke cache) ✓ Dihitung terhadap ITPM
  • cache_read_input_tokens (token yang dibaca dari cache) ✗ TIDAK dihitung terhadap ITPM untuk sebagian besar model

Contoh: Dengan batas 2.000.000 ITPM dan tingkat cache hit 80%, Anda dapat secara efektif memproses 10.000.000 total token input per menit (2 juta tidak di-cache + 8 juta di-cache), karena token yang di-cache tidak dihitung terhadap batas laju Anda.

Untuk memaksimalkan batas laju Anda, cache konten yang berulang seperti instruksi sistem dan prompt, dokumen konteks besar, definisi alat, dan riwayat percakapan; lihat caching prompt untuk panduan. Dengan caching yang efektif, Anda dapat meningkatkan throughput aktual Anda secara substansial tanpa menaikkan batas laju Anda. Pantau tingkat cache hit Anda di halaman Usage untuk menyempurnakan strategi caching Anda.

Batas laju OTPM dievaluasi secara real time saat token output dihasilkan, hanya menghitung token aktual yang dihasilkan. Parameter max_tokens tidak diperhitungkan dalam kalkulasi batas laju OTPM, sehingga tidak ada kerugian batas laju dalam menetapkan nilai max_tokens yang lebih tinggi.

Batas laju diterapkan secara terpisah untuk setiap model; oleh karena itu Anda dapat menggunakan model yang berbeda hingga batas masing-masing secara bersamaan. Anda dapat memeriksa batas laju dan perilaku Anda saat ini di halaman Rate limits di Claude Console, atau membaca batas yang dikonfigurasi secara terprogram dengan Rate Limits API.

ModelPermintaan maksimum per menit (RPM)Token input maksimum per menit (ITPM)Token output maksimum per menit (OTPM)
Claude Fable 5.x11.000500.000100.000
Claude Opus 5.51.0002.000.000400.000
Claude Opus 51.0002.000.000400.000
Claude Opus 4.x21.0002.000.000400.000
Claude Sonnet 5.51.0002.000.000400.000
Claude Sonnet 51.0002.000.000400.000
Claude Sonnet 4.x31.0002.000.000400.000
Claude Haiku 4.51.0002.000.000400.000
Claude Haiku 3.5 (dihentikan, kecuali di Bedrock dan Google Cloud)1.000100.000420.000

1 Batas laju Fable adalah batas total yang berlaku untuk lalu lintas gabungan di Claude Fable 5.1 dan Claude Fable 5. Claude Mythos 5.1 dan Claude Mythos 5 berbagi batas gabungan terpisah dengan ketentuan yang sama.

2 Batas laju Opus adalah batas total yang berlaku untuk gabungan lalu lintas di Claude Opus 4.8, Opus 4.7, Opus 4.6, dan Opus 4.5. Claude Opus 5.5 dan Claude Opus 5 masing-masing memiliki batas laju terpisah dan tidak termasuk dalam kelompok gabungan ini.

3 Batas laju Sonnet 4.x adalah batas total yang berlaku untuk gabungan lalu lintas di Sonnet 4.6 dan Sonnet 4.5. Claude Sonnet 5.5 dan Claude Sonnet 5 masing-masing memiliki batas laju terpisah dan tidak termasuk dalam kelompok gabungan ini.

4 Batas ini menghitung cache_read_input_tokens terhadap penggunaan ITPM.

Message Batches API

Message Batches API memiliki serangkaian batas lajunya sendiri yang dibagi bersama di semua model. Ini mencakup batas permintaan per menit (RPM) untuk semua endpoint API dan batas jumlah permintaan batch yang dapat berada dalam antrean pemrosesan pada waktu yang sama. "Permintaan batch" di sini mengacu pada bagian dari sebuah Message Batch. Anda dapat membuat Message Batch yang berisi ribuan permintaan batch, yang masing-masing dihitung terhadap batas ini. Sebuah permintaan batch dianggap sebagai bagian dari antrean pemrosesan ketika belum berhasil diproses oleh model.

Permintaan maksimum per menit (RPM)Permintaan batch maksimum dalam antrean pemrosesanPermintaan batch maksimum per batch
1.000200.000100.000

Managed Agents

Endpoint Claude Managed Agents dibatasi lajunya per organisasi. Batas ini terpisah dari batas laju Messages API di atas.

OperasiBatas
Endpoint pembuatan (misalnya, agen, sesi, dan lingkungan)300 permintaan per menit
Endpoint pembacaan (misalnya, retrieve, list, dan stream)1.200 permintaan per menit

Files API

Permintaan Files API memiliki batas per organisasinya sendiri, yang dibagi bersama di seluruh operasi upload, list, retrieve, download, dan delete serta terpisah dari batas Messages API yang dijelaskan sebelumnya di halaman ini. Lihat batas laju Files API untuk nilai saat ini.

Batas laju fast mode

Saat menggunakan fast mode (pratinjau riset) dengan speed: "fast" pada Claude Opus 5.5, Claude Opus 5, atau Opus 4.8, berlaku batas laju khusus yang terpisah dari batas laju Opus standar. Ketika batas laju fast mode terlampaui, API mengembalikan error 429 dengan header retry-after. Fast mode tidak tersedia di Claude Opus 4.7 (permintaan mengembalikan error) atau Claude Opus 4.6 (permintaan ke claude-opus-4-6 dengan speed: "fast" berjalan pada kecepatan standar). Lihat Fast mode.

Respons menyertakan header anthropic-fast-* yang menunjukkan status batas laju fast mode Anda. Lihat Batas laju fast mode untuk detail tentang header ini.

Memantau batas laju Anda di Console

Anda dapat memantau penggunaan batas laju Anda di halaman Usage di Claude Console.

Selain menyediakan grafik token dan permintaan, halaman Usage menyediakan dua grafik batas laju terpisah. Gunakan grafik ini untuk melihat ruang yang Anda miliki untuk berkembang, mengidentifikasi kapan Anda mungkin mencapai penggunaan puncak, memahami batas laju apa yang perlu diminta, dan mempelajari cara meningkatkan tingkat caching Anda. Grafik tersebut memvisualisasikan sejumlah metrik untuk batas laju tertentu (misalnya, per model):

  • Grafik Rate Limit - Input Tokens mencakup:
    • Maksimum per jam dari token input yang tidak di-cache per menit
    • Batas laju token input per menit Anda saat ini
    • Tingkat cache untuk token input Anda (yaitu, persentase token input yang dibaca dari cache)
  • Grafik Rate Limit - Output Tokens mencakup:
    • Maksimum per jam dari token output per menit
    • Batas laju token output per menit Anda saat ini

Meminta batas yang lebih tinggi

Untuk meminta batas laju yang lebih tinggi atau batas pengeluaran bulanan yang lebih tinggi, gunakan Request rate limit increase di halaman Rate limits. Dukungan Anthropic juga dapat menaikkan batas; untuk kebutuhan mendesak, hubungi dukungan Anthropic.

Menetapkan batas yang lebih rendah untuk Workspace

Untuk informasi lebih lanjut tentang workspace, lihat Workspaces.

Untuk melindungi Workspace di Organisasi Anda dari potensi penggunaan berlebih, Anda dapat menetapkan batas pengeluaran dan batas laju kustom per Workspace.

Contoh: Jika batas Organisasi Anda adalah 40.000 token input per menit dan 8.000 token output per menit, Anda dapat membatasi satu Workspace hingga 30.000 token input per menit. Ini melindungi Workspace lain dari potensi penggunaan berlebih dan memastikan distribusi sumber daya yang lebih merata di seluruh Organisasi Anda. Sisa token per menit yang tidak terpakai (atau lebih, jika Workspace tersebut tidak menggunakan batasnya) kemudian tersedia untuk digunakan oleh Workspace lain.

Catatan:

  • Anda tidak dapat menetapkan batas pada Workspace default.
  • Jika tidak ditetapkan, batas Workspace sama dengan batas Organisasi.
  • Batas Workspace ditetapkan per jenis pembatas (seperti permintaan per menit, token input per menit, atau token output per menit).
  • Batas tingkat Organisasi selalu berlaku, meskipun jumlah batas Workspace lebih besar.

Untuk membaca batas laju organisasi dan workspace Anda saat ini secara terprogram, gunakan Rate Limits API.

Header respons

Respons API menyertakan header yang menunjukkan batas laju yang diberlakukan, penggunaan saat ini, dan kapan batas akan direset.

Header berikut dikembalikan:

HeaderDeskripsi
retry-afterJumlah detik yang harus ditunggu hingga Anda dapat mencoba ulang permintaan. Percobaan ulang yang lebih awal akan gagal. Tidak dikirim bersama 429 batas pengeluaran (lihat Mencapai batas pengeluaran Anda).
anthropic-ratelimit-requests-limitJumlah maksimum permintaan yang diizinkan dalam periode batas laju apa pun.
anthropic-ratelimit-requests-remainingJumlah permintaan yang tersisa sebelum dibatasi lajunya.
anthropic-ratelimit-requests-resetWaktu ketika batas laju permintaan akan terisi penuh kembali, disediakan dalam format RFC 3339.
anthropic-ratelimit-tokens-limitJumlah maksimum token yang diizinkan dalam periode batas laju apa pun.
anthropic-ratelimit-tokens-remainingJumlah token yang tersisa (dibulatkan ke ribuan terdekat) sebelum dibatasi lajunya.
anthropic-ratelimit-tokens-resetWaktu ketika batas laju token akan terisi penuh kembali, disediakan dalam format RFC 3339.
anthropic-ratelimit-input-tokens-limitJumlah maksimum token input yang diizinkan dalam periode batas laju apa pun.
anthropic-ratelimit-input-tokens-remainingJumlah token input yang tersisa (dibulatkan ke ribuan terdekat) sebelum dibatasi lajunya.
anthropic-ratelimit-input-tokens-resetWaktu ketika batas laju token input akan terisi penuh kembali, disediakan dalam format RFC 3339.
anthropic-ratelimit-output-tokens-limitJumlah maksimum token output yang diizinkan dalam periode batas laju apa pun.
anthropic-ratelimit-output-tokens-remainingJumlah token output yang tersisa (dibulatkan ke ribuan terdekat) sebelum dibatasi lajunya.
anthropic-ratelimit-output-tokens-resetWaktu ketika batas laju token output akan terisi penuh kembali, disediakan dalam format RFC 3339.
anthropic-priority-input-tokens-limitJumlah maksimum token input Priority Tier yang diizinkan dalam periode batas laju apa pun. (Hanya Priority Tier)
anthropic-priority-input-tokens-remainingJumlah token input Priority Tier yang tersisa (dibulatkan ke ribuan terdekat) sebelum dibatasi lajunya. (Hanya Priority Tier)
anthropic-priority-input-tokens-resetWaktu ketika batas laju token input Priority Tier akan terisi penuh kembali, disediakan dalam format RFC 3339. (Hanya Priority Tier)
anthropic-priority-output-tokens-limitJumlah maksimum token output Priority Tier yang diizinkan dalam periode batas laju apa pun. (Hanya Priority Tier)
anthropic-priority-output-tokens-remainingJumlah token output Priority Tier yang tersisa (dibulatkan ke ribuan terdekat) sebelum dibatasi lajunya. (Hanya Priority Tier)
anthropic-priority-output-tokens-resetWaktu ketika batas laju token output Priority Tier akan terisi penuh kembali, disediakan dalam format RFC 3339. (Hanya Priority Tier)

Header anthropic-ratelimit-tokens-* menampilkan nilai untuk batas paling ketat yang sedang berlaku. Misalnya, jika Anda telah melampaui batas token per menit Workspace, header akan berisi nilai batas laju token per menit Workspace. Jika batas Workspace tidak berlaku, header akan mengembalikan total token yang tersisa, di mana total adalah jumlah token input dan output. Pendekatan ini memastikan Anda memiliki visibilitas terhadap kendala yang paling relevan pada penggunaan API Anda saat ini. Untuk melihat Workspace mana yang diperhitungkan untuk suatu permintaan, baca header respons anthropic-workspace-id, yang membawa ID Workspace yang menjadi tujuan resolusi kunci API atau token akses Anda.

Was this page helpful?