Claude Platform Docs
MessagesInfrastruktur alat

Mengelola konteks alat

Pilih antara pencarian alat, pemanggilan alat terprogram, caching prompt, dan pengeditan konteks untuk mengelola pembengkakan konteks.

Definisi alat dan blok tool_result yang terakumulasi menghabiskan "context window" (jendela konteks) Anda. Agen yang berjalan lama dengan banyak alat atau banyak giliran dapat menghabiskan konteks yang tersedia sebelum tugas selesai. Empat pendekatan mengatasi hal ini di titik yang berbeda dalam pipeline.

Empat pendekatan

Setiap pendekatan menargetkan sumber tekanan konteks yang berbeda. Pilih pendekatan yang sesuai dengan ke mana token Anda mengalir.

PendekatanApa yang dikurangiKapan cocok digunakanPelajari lebih lanjut
Pencarian alatDefinisi alat yang dimuat di awalKumpulan alat besar (20+ alat) di mana sebagian besar alat tidak diperlukan setiap giliranAlat pencarian alat
Pemanggilan alat terprogramPerjalanan bolak-balik tool_resultRangkaian pemanggilan alat yang dapat dieksekusi sebagai satu skripPemanggilan alat terprogram
Caching promptBiaya token dari definisi alat yang berulangKumpulan alat yang stabil di banyak permintaanPenggunaan alat dengan caching prompt
Pengeditan konteksBlok tool_result lama dalam riwayatPercakapan panjang di mana hasil awal tidak lagi relevanPengeditan konteks

"Tool search" (pencarian alat) menjaga definisi alat tetap di luar jendela konteks sampai Claude memintanya. Alih-alih mengirim 50 skema alat di awal, Anda mengirim satu alat tool_search dan membiarkan Claude menemukan sisanya sesuai permintaan. Ini menukar sedikit "latency" (latensi) (satu giliran tambahan untuk mencari alat) dengan pengurangan besar dalam penggunaan konteks dasar.

Pemanggilan alat terprogram

"Programmatic tool calling" (pemanggilan alat terprogram) meringkas serangkaian pemanggilan alat menjadi satu blok kode yang ditulis Claude dan dijalankan oleh sandbox eksekusi kode Anthropic. Alih-alih lima perjalanan bolak-balik tool_use dan tool_result, Claude menghasilkan satu skrip yang memanggil kelima fungsi dari dalam sandbox. Hasil perantara tidak pernah masuk ke riwayat percakapan.

Caching prompt

"Prompt caching" (caching prompt) tidak mengurangi jumlah token dalam konteks, tetapi mengurangi biaya yang Anda bayar untuk token tersebut pada permintaan berikutnya. Jika definisi alat Anda stabil, cache sekali dan gunakan kembali prefiks yang di-cache di ribuan permintaan. Ini adalah pilihan yang tepat ketika kumpulan alat besar tetapi tetap.

Pengeditan konteks

"Context editing" (pengeditan konteks) menghapus blok tool_result lama dari riwayat percakapan setelah blok tersebut memenuhi tujuannya. Loop agen yang panjang mungkin menghasilkan ratusan hasil perantara yang berguna pada saat itu tetapi sekarang menjadi beban mati. Pengeditan konteks memungkinkan Anda memangkasnya tanpa memulai ulang percakapan.

Menggabungkan pendekatan

Pendekatan-pendekatan ini dapat dikombinasikan. Agen yang berjalan lama mungkin menggunakan pencarian alat untuk menjaga kumpulan alat tetap ramping, caching prompt untuk mengamortisasi biaya definisi yang tersisa, dan pengeditan konteks untuk memangkas hasil yang sudah usang seiring bertambahnya percakapan. Masing-masing menyelesaikan bagian masalah yang berbeda, sehingga tidak ada konflik dalam menggunakannya bersama-sama.

Titik awal yang masuk akal untuk agen bervolume tinggi:

  1. Aktifkan caching prompt pada definisi alat Anda sejak hari pertama. Penulisan cache dikenakan markup 25% di atas harga input dasar, yang terbayar kembali pada permintaan kedua yang mengenai cache.
  2. Tambahkan pencarian alat setelah kumpulan alat Anda bertambah melebihi sekitar 20 alat atau penggunaan konteks dasar Anda menjadi terasa.
  3. Tambahkan pengeditan konteks setelah percakapan individual mulai berjalan cukup lama sehingga hasil awal menjadi tidak relevan.
  4. Pertimbangkan pemanggilan alat terprogram jika Anda melihat rangkaian berulang dari pemanggilan alat kecil yang dapat dijalankan sebagai satu batch.

Langkah selanjutnya

Muat definisi alat sesuai permintaan alih-alih di awal.

Ringkas rangkaian pemanggilan alat menjadi satu skrip yang dapat dieksekusi.

Cache definisi alat di seluruh permintaan untuk memangkas biaya token.

Pangkas hasil alat yang sudah usang dari percakapan yang berjalan lama.

Was this page helpful?