Mode cepat (pratinjau riset)
Dapatkan token output per detik hingga 2,5x lebih tinggi dari model Claude Opus yang didukung.
"Fast mode" (mode cepat) memberikan token output per detik hingga 2,5x lebih tinggi dari Claude Opus 5.5, Claude Opus 5, dan Claude Opus 4.8 dengan harga premium. Untuk ikut serta, atur speed: "fast" dengan header beta fast-mode-2026-02-01 pada permintaan Anda.
Model yang didukung
Mode cepat didukung pada model-model berikut:
- Claude Opus 5.5 ()
- Claude Opus 5 ()
- Claude Opus 4.8 ()
Cara kerja mode cepat
Mode cepat menjalankan model yang sama dengan konfigurasi inferensi yang lebih cepat. Tidak ada perubahan pada kecerdasan atau kemampuan.
- Token output per detik hingga 2,5x lebih tinggi dibandingkan kecepatan standar
- Manfaat kecepatan berfokus pada "output tokens per second" (token output per detik), atau OTPS, bukan "time to first token" (waktu hingga token pertama), atau TTFT
- Bobot dan perilaku model yang sama (bukan model yang berbeda)
- Kompatibel dengan streaming, di mana peningkatan OTPS paling terlihat
Penggunaan dasar
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5-5",
max_tokens=4096,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[
{"role": "user", "content": "Refactor this module to use dependency injection"}
],
)
for block in response.content:
if block.type == "text":
print(block.text)Harga
Mode cepat dihargai dengan pengali terhadap tarif standar di seluruh jendela konteks (context window), termasuk permintaan dengan lebih dari 200k token input. Tabel berikut menunjukkan harga mode cepat untuk model yang didukung:
| Model | Input | Output |
|---|---|---|
| Claude Opus 5.5 | $8 USD / MTok | $40 USD / MTok |
| Claude Opus 5 / Claude Opus 4.8 | $10 USD / MTok | $50 USD / MTok |
Harga mode cepat bertumpuk dengan pengubah harga lainnya:
- Pengali caching prompt berlaku di atas harga mode cepat
- Pengali residensi data berlaku di atas harga mode cepat
Untuk detail harga lengkap, lihat halaman Harga.
Batas laju
Mode cepat memiliki batas laju (rate limit) khusus yang terpisah dari batas laju Opus standar. Ketika batas laju mode cepat Anda terlampaui, API mengembalikan error 429 dengan header retry-after yang menunjukkan kapan kapasitas akan tersedia.
Respons menyertakan header yang menunjukkan status batas laju mode cepat Anda:
| Header | Deskripsi |
|---|---|
anthropic-fast-input-tokens-limit | Token input mode cepat maksimum per menit |
anthropic-fast-input-tokens-remaining | Token input mode cepat yang tersisa |
anthropic-fast-input-tokens-reset | Waktu ketika batas token input mode cepat direset |
anthropic-fast-output-tokens-limit | Token output mode cepat maksimum per menit |
anthropic-fast-output-tokens-remaining | Token output mode cepat yang tersisa |
anthropic-fast-output-tokens-reset | Waktu ketika batas token output mode cepat direset |
Untuk batas laju spesifik per tingkat, lihat halaman Batas laju.
Memeriksa kecepatan mana yang digunakan
Objek usage pada respons menyertakan field speed yang menunjukkan kecepatan mana yang digunakan, baik "fast" maupun "standard". Meminta speed: "fast" pada model yang tidak mendukung mode cepat mengembalikan error, begitu pula jika melampaui batas laju atau kapasitas mode cepat (429 atau 529). Ketika permintaan dengan speed: "fast" berhasil, usage.speed bernilai "fast". Jika Anda menggunakan Claude Opus 4.6 dan meminta mode cepat, perilakunya unik. Alih-alih mengembalikan error seperti model lain yang tidak mendukung mode cepat, model ini secara diam-diam beralih ke kecepatan standar. Meskipun tidak ada error pada Opus 4.6, field speed secara akurat menampilkan "standard".
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5-5",
max_tokens=1024,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[{"role": "user", "content": "Hello"}],
)
print(response.usage.speed) # "fast" or "standard"{
"id": "msg_01XFDUDYJgAACzvnptvVoYEL",
"type": "message",
"role": "assistant",
"usage": {
"input_tokens": 8,
"output_tokens": 12,
"speed": "fast"
}
}Untuk melacak penggunaan dan biaya mode cepat di seluruh organisasi Anda, lihat Usage and Cost API.
Percobaan ulang dan fallback
Percobaan ulang otomatis
Ketika batas laju mode cepat terlampaui, API mengembalikan error 429 dengan header retry-after. SDK Anthropic secara otomatis mencoba ulang permintaan ini hingga 2 kali secara default (dapat dikonfigurasi dengan max_retries), dengan menunggu jeda yang ditentukan server sebelum setiap percobaan ulang. Karena mode cepat menggunakan pengisian ulang token secara berkelanjutan, jeda retry-after biasanya singkat dan permintaan berhasil begitu kapasitas tersedia.
Beralih kembali ke kecepatan standar
Jika Anda lebih memilih beralih ke kecepatan standar daripada menunggu kapasitas mode cepat, tangkap error batas laju dan coba ulang tanpa speed: "fast". Atur max_retries ke 0 pada permintaan cepat awal untuk melewati percobaan ulang otomatis dan langsung gagal saat terjadi error batas laju.
Karena mengatur max_retries ke 0 juga menonaktifkan percobaan ulang untuk error sementara lainnya (overloaded, error server internal), contoh-contoh berikut mengirim ulang permintaan asli dengan percobaan ulang default untuk kasus-kasus tersebut.
client = anthropic.Anthropic()
def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
try:
return client.with_options(max_retries=max_retries).beta.messages.create(
**params
)
except anthropic.RateLimitError:
if params.get("speed") == "fast":
del params["speed"]
return create_message_with_fast_fallback(max_retries=max_retries, **params)
raise
except (
anthropic.APIStatusError,
anthropic.APIConnectionError,
) as error:
if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
raise
if max_attempts > 1:
return create_message_with_fast_fallback(
max_retries=max_retries, max_attempts=max_attempts - 1, **params
)
raise
message = create_message_with_fast_fallback(
model="claude-opus-5-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello"}],
betas=["fast-mode-2026-02-01"],
speed="fast",
max_retries=0,
)Pertimbangan
- Caching prompt: Beralih antara kecepatan cepat dan standar membatalkan prompt cache. Permintaan pada kecepatan yang berbeda tidak berbagi prefiks yang di-cache.
- Model yang didukung: Mode cepat didukung pada Claude Opus 5.5, Claude Opus 5, dan Claude Opus 4.8. Lihat Model yang didukung.
- TTFT: Manfaat mode cepat berfokus pada token output per detik (OTPS), bukan waktu hingga token pertama (TTFT).
- Batch API: Mode cepat tidak tersedia dengan Batch API.
- Priority Tier: Mode cepat tidak tersedia dengan komitmen Priority Tier.
- Claude Platform on AWS: Mode cepat saat ini tidak tersedia di Claude Platform on AWS.
Langkah selanjutnya
Dapatkan hasil JSON yang tervalidasi dari alur kerja agen.
Pelajari struktur harga Anthropic untuk model dan fitur.
Kendalikan berapa banyak token yang digunakan Claude saat merespons dengan parameter effort, menyeimbangkan antara ketelitian respons dan efisiensi token.
Lakukan streaming respons Messages API secara bertahap dengan server-sent events, termasuk delta teks, penggunaan alat, dan pemikiran diperpanjang.
Was this page helpful?