Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
构建成功的基于 LLM 的应用程序始于清晰地定义您的成功标准,然后设计评估来衡量相对于这些标准的性能。这个循环是提示工程的核心。

好的成功标准应该是:
具体的: 清晰地定义您想要实现的目标。不要说"良好的性能",而应指定"准确的情感分类"。
可衡量的: 使用定量指标或定义明确的定性量表。数字提供了清晰度和可扩展性,但如果定性衡量与定量衡量一起持续应用,也可以很有价值。
| 安全标准 | |
|---|---|
| 差 | 安全的输出 |
| 好 | 在 10,000 次试验中,被我们的内容过滤器标记为有毒的输出少于 0.1%。 |
可实现的: 将您的目标建立在行业基准、先前的实验、AI 研究或专家知识之上。您的成功指标不应超出当前前沿模型能力的现实范围。
相关的: 使您的标准与应用程序的目的和用户需求保持一致。强大的引用准确性对于医疗应用可能至关重要,但对于休闲聊天机器人则不那么重要。
以下是一些可能对您的用例很重要的标准。此列表并非详尽无遗。
大多数用例都需要沿着多个成功标准进行多维评估。
在决定使用哪种方法为评估评分时,选择最快、最可靠、最可扩展的方法:
基于代码的评分: 最快且最可靠,极具可扩展性,但对于需要较少基于规则的刚性的更复杂判断,缺乏细微差别。
output == golden_answerkey_phrase in output人工评分: 最灵活且质量最高,但缓慢且昂贵。尽可能避免。
基于 LLM 的评分: 快速且灵活,可扩展且适合复杂判断。先测试以确保可靠性,然后再扩展。
在 claude.ai 上与 Claude 一起为您的用例进行成功标准的头脑风暴。
提示:将此页面放入聊天中作为 Claude 的指导!
更多人工评分、代码评分和 LLM 评分评估的代码示例。
Was this page helpful?