Claude Platform Docs
最佳實務測試與評估

定義成功標準並建立評估

為您的 LLM 應用程式定義可衡量的成功標準,並建立評估來進行測試,從精確比對檢查到基於 LLM 的評分。

建立一個成功的基於 LLM 的應用程式,首先要清楚定義您的成功標準,然後設計評估來衡量相對於這些標準的表現。這個循環是「prompt engineering」(提示工程)的核心。

提示工程流程圖:測試案例、初步提示、反覆測試與改進、最終驗證、發布

定義您的成功標準

良好的成功標準應具備以下特點:

  • 具體(Specific): 清楚定義您想要達成的目標。與其說「良好的表現」,不如具體說明「準確的情感分類」。

  • 可衡量(Measurable): 使用量化指標或定義明確的質化量表。數字能提供清晰度與可擴展性,但若能與量化衡量方式一併持續一致地應用,質化衡量方式也很有價值。

    • 即使是倫理與安全等「模糊」的主題也可以量化:
      安全標準
      不佳安全的輸出
      良好在 10,000 次試驗中,被內容過濾器標記為有毒性的輸出少於 0.1%。

  • 可達成(Achievable): 以產業基準、先前的實驗、AI 研究或專家知識作為目標的依據。您的成功指標不應超出當前前沿模型能力的現實範圍。

  • 相關(Relevant): 讓您的標準與應用程式的目的及使用者需求保持一致。高度的引用準確性對醫療應用程式可能至關重要,但對休閒聊天機器人則較不重要。

常見的成功標準

以下是一些可能對您的使用案例很重要的標準。此清單並非詳盡無遺。

大多數使用案例需要依據多項成功標準進行多維度評估。


建立評估

評估設計原則

  1. 針對特定任務: 設計能反映您真實世界任務分布的評估。別忘了將邊緣案例納入考量!

  2. 盡可能自動化: 將問題結構化以便進行自動評分(例如選擇題、字串比對、程式碼評分、LLM 評分)。
  3. 數量優先於品質: 較多問題搭配訊號稍弱的自動評分,勝過較少問題搭配高品質的人工手動評分評估。

評估範例


為您的評估評分

在決定使用哪種方法為評估評分時,請選擇最快速、最可靠、最具可擴展性的方法:

  1. 基於程式碼的評分: 最快速且最可靠,可擴展性極高,但對於需要較少規則式僵化的複雜判斷則缺乏細膩度。

    • 精確比對:output == golden_answer
    • 字串比對:key_phrase in output
  2. 人工評分: 最具彈性且品質最高,但緩慢且昂貴。盡可能避免。

  3. 基於 LLM 的評分: 快速且具彈性,可擴展且適合複雜判斷。請先測試以確保可靠性,再進行擴展。

基於 LLM 評分的技巧

  • 制定詳細、清楚的評分標準: 「答案應始終在第一句中提及『Acme Inc.』。若未提及,該答案將自動評為『不正確』。」
  • 實證或具體: 例如,指示 LLM 僅輸出「correct」或「incorrect」,或以 1–5 的量表進行判斷。純質化的評估難以快速且大規模地評量。
  • 鼓勵推理: 要求 LLM 在產生評估分數之前先進行推理,然後捨棄推理內容。這能提升評估表現,特別是對於需要複雜判斷的任務。

後續步驟

在 claude.ai 上與 Claude 一起為您的使用案例腦力激盪成功標準。

提示: 將此頁面放入聊天中作為 Claude 的指引!

更多人工評分、程式碼評分及 LLM 評分評估的程式碼範例。

Was this page helpful?