Claude Platform Docs
Praktik terbaikUji dan evaluasi

Tentukan kriteria keberhasilan dan bangun evaluasi

Tentukan kriteria keberhasilan yang terukur untuk aplikasi LLM Anda dan bangun evaluasi untuk mengujinya, mulai dari pemeriksaan kecocokan persis hingga penilaian berbasis LLM.

Membangun aplikasi berbasis LLM yang sukses dimulai dengan mendefinisikan kriteria keberhasilan Anda secara jelas, lalu merancang evaluasi untuk mengukur kinerja terhadap kriteria tersebut. Siklus ini merupakan inti dari "prompt engineering" (rekayasa prompt).

Diagram alur prompt engineering: kasus uji, prompt awal, pengujian dan penyempurnaan berulang, validasi akhir, rilis

Tentukan kriteria keberhasilan Anda

Kriteria keberhasilan yang baik bersifat:

  • Spesifik: Definisikan dengan jelas apa yang ingin Anda capai. Alih-alih "kinerja yang baik," tentukan "klasifikasi sentimen yang akurat."

  • Terukur: Gunakan metrik kuantitatif atau skala kualitatif yang terdefinisi dengan baik. Angka memberikan kejelasan dan skalabilitas, tetapi ukuran kualitatif dapat bernilai jika diterapkan secara konsisten bersama dengan ukuran kuantitatif.

    • Bahkan topik yang "kabur" seperti etika dan keamanan dapat dikuantifikasi:
      Kriteria keamanan
      BurukOutput yang aman
      BaikKurang dari 0,1% output dari 10.000 percobaan ditandai sebagai toksik oleh filter konten.

  • Dapat dicapai: Dasarkan target Anda pada tolok ukur industri, eksperimen sebelumnya, riset AI, atau pengetahuan ahli. Metrik keberhasilan Anda tidak boleh tidak realistis terhadap kemampuan model frontier saat ini.

  • Relevan: Selaraskan kriteria Anda dengan tujuan aplikasi dan kebutuhan pengguna Anda. Akurasi sitasi yang kuat mungkin sangat penting untuk aplikasi medis tetapi kurang penting untuk chatbot kasual.

Kriteria keberhasilan umum

Berikut beberapa kriteria yang mungkin penting untuk kasus penggunaan Anda. Daftar ini tidak lengkap.

Sebagian besar kasus penggunaan memerlukan evaluasi multidimensi berdasarkan beberapa kriteria keberhasilan.


Bangun evaluasi

Prinsip desain eval

  1. Spesifik terhadap tugas: Rancang eval yang mencerminkan distribusi tugas dunia nyata Anda. Jangan lupa memperhitungkan kasus tepi!

  2. Otomatiskan jika memungkinkan: Susun pertanyaan agar memungkinkan penilaian otomatis (misalnya, pilihan ganda, kecocokan string, dinilai dengan kode, dinilai dengan LLM).
  3. Prioritaskan volume daripada kualitas: Lebih banyak pertanyaan dengan penilaian otomatis yang sinyalnya sedikit lebih rendah lebih baik daripada lebih sedikit pertanyaan dengan eval berkualitas tinggi yang dinilai manual oleh manusia.

Contoh eval


Nilai evaluasi Anda

Saat memutuskan metode mana yang akan digunakan untuk menilai eval, pilih metode yang paling cepat, paling andal, dan paling skalabel:

  1. Penilaian berbasis kode: Paling cepat dan paling andal, sangat skalabel, tetapi kurang bernuansa untuk penilaian yang lebih kompleks yang membutuhkan kekakuan berbasis aturan yang lebih rendah.

    • Kecocokan persis: output == golden_answer
    • Kecocokan string: key_phrase in output
  2. Penilaian manusia: Paling fleksibel dan berkualitas tinggi, tetapi lambat dan mahal. Hindari jika memungkinkan.

  3. Penilaian berbasis LLM: Cepat dan fleksibel, skalabel dan cocok untuk penilaian kompleks. Uji terlebih dahulu untuk memastikan keandalan, lalu skalakan.

Tips untuk penilaian berbasis LLM

  • Miliki rubrik yang detail dan jelas: "Jawaban harus selalu menyebutkan 'Acme Inc.' di kalimat pertama. Jika tidak, jawaban otomatis dinilai sebagai 'salah.'"
  • Empiris atau spesifik: Misalnya, instruksikan LLM untuk hanya mengeluarkan 'correct' atau 'incorrect', atau menilai dari skala 1–5. Evaluasi yang murni kualitatif sulit dinilai dengan cepat dan dalam skala besar.
  • Dorong penalaran: Minta LLM untuk bernalar terlebih dahulu sebelum menghasilkan skor evaluasi, lalu buang penalarannya. Ini meningkatkan kinerja evaluasi, terutama untuk tugas yang membutuhkan penilaian kompleks.

Langkah selanjutnya

Bertukar pikiran tentang kriteria keberhasilan untuk kasus penggunaan Anda bersama Claude di claude.ai.

Tip: Masukkan halaman ini ke dalam chat sebagai panduan untuk Claude!

Lebih banyak contoh kode eval yang dinilai oleh manusia, kode, dan LLM.

Was this page helpful?