Claude Platform Docs
最佳实践测试与评估

定义成功标准并构建评估

为您的 LLM 应用定义可衡量的成功标准,并构建评估来对其进行测试,从精确匹配检查到基于 LLM 的评分。

构建一个成功的基于 LLM 的应用,首先要清晰地定义您的成功标准,然后设计评估来衡量相对于这些标准的表现。这一循环是 "prompt engineering"(提示工程)的核心。

提示工程流程图:test cases(测试用例)、preliminary prompt(初步提示)、iterative testing and refinement(迭代测试与优化)、final validation(最终验证)、ship(发布)

定义您的成功标准

好的成功标准应当是:

  • 具体的(Specific): 清晰地定义您想要实现的目标。不要说"良好的性能",而要具体说明"准确的情感分类"。

  • 可衡量的(Measurable): 使用定量指标或定义明确的定性量表。数字能带来清晰性和可扩展性,但如果定性衡量方式能够与定量衡量方式一起被一致地应用,它们也可以很有价值。

    • 即使是伦理和安全等"模糊"的主题也可以被量化:
      安全标准
      安全的输出
      在 10,000 次试验中,被内容过滤器标记为有毒的输出少于 0.1%。

  • 可实现的(Achievable): 基于行业基准、先前的实验、AI 研究或专家知识来设定您的目标。您的成功指标不应超出当前前沿模型能力的现实范围。

  • 相关的(Relevant): 使您的标准与应用的目的和用户需求保持一致。强大的引用准确性对于医疗应用可能至关重要,但对于休闲聊天机器人则不那么重要。

常见的成功标准

以下是一些可能对您的用例很重要的标准。此列表并非详尽无遗。

大多数用例需要沿多个成功标准进行多维度评估。


构建评估

评估设计原则

  1. 针对特定任务: 设计能够反映您真实世界任务分布的评估。不要忘记考虑边缘案例!

  2. 尽可能自动化: 以允许自动评分的方式组织问题(例如,多项选择、字符串匹配、代码评分、LLM 评分)。
  3. 数量优先于质量: 更多的问题配合信号稍弱的自动评分,要好于更少的问题配合高质量的人工手动评分评估。

评估示例


为您的评估评分

在决定使用哪种方法为评估评分时,请选择最快、最可靠、最具可扩展性的方法:

  1. 基于代码的评分: 最快且最可靠,可扩展性极强,但对于需要较少基于规则的刚性的更复杂判断而言,缺乏细微差别。

    • 精确匹配:output == golden_answer
    • 字符串匹配:key_phrase in output
  2. 人工评分: 最灵活且质量最高,但速度慢且成本高。尽可能避免。

  3. 基于 LLM 的评分: 快速且灵活,可扩展且适合复杂判断。先进行测试以确保可靠性,然后再扩展规模。

基于 LLM 的评分技巧

  • 制定详细、清晰的评分标准: "答案应始终在第一句中提到 'Acme Inc.'。如果没有,该答案将自动被评为'不正确'。"
  • 实证的或具体的: 例如,指示 LLM 仅输出 'correct' 或 'incorrect',或者按 1–5 的量表进行判断。纯定性的评估难以快速且大规模地进行评估。
  • 鼓励推理: 要求 LLM 在给出评估分数之前先进行推理,然后丢弃推理内容。这可以提高评估性能,特别是对于需要复杂判断的任务。

后续步骤

在 claude.ai 上与 Claude 一起为您的用例头脑风暴成功标准。

提示: 将此页面放入聊天中作为 Claude 的指导!

更多人工评分、代码评分和 LLM 评分评估的代码示例。

Was this page helpful?