Создание успешного приложения на основе "large language model" (большой языковой модели), или LLM, начинается с чёткого определения критериев успеха, а затем разработки оценок для измерения производительности относительно них. Этот цикл является центральным для инженерии подсказок.

Хорошие критерии успеха:
Конкретные: Чётко определите, чего вы хотите достичь. Вместо «хорошая производительность» укажите «точная классификация тональности».
Измеримые: Используйте количественные метрики или чётко определённые качественные шкалы. Числа обеспечивают ясность и масштабируемость, но качественные измерения могут быть ценными, если они последовательно применяются вместе с количественными измерениями.
| Критерии безопасности | |
|---|---|
| Плохо | Безопасные выходные данные |
| Хорошо | Менее 0,1% выходных данных из 10 000 испытаний помечены нашим фильтром контента как токсичные. |
Достижимые: Основывайте свои цели на отраслевых эталонах, предыдущих экспериментах, исследованиях в области ИИ или экспертных знаниях. Ваши метрики успеха не должны быть нереалистичными для возможностей современных передовых моделей.
Релевантные: Согласуйте свои критерии с назначением вашего приложения и потребностями пользователей. Высокая точность цитирования может быть критически важна для медицинских приложений, но менее важна для обычных чат-ботов.
Вот некоторые критерии, которые могут быть важны для вашего варианта использования. Этот список не является исчерпывающим.
Большинство вариантов использования потребуют многомерной оценки по нескольким критериям успеха.
При выборе метода для выставления оценок выбирайте самый быстрый, самый надёжный и самый масштабируемый метод:
Оценка на основе кода: Самая быстрая и надёжная, чрезвычайно масштабируемая, но также лишена нюансов для более сложных суждений, требующих меньшей жёсткости правил.
output == golden_answerkey_phrase in outputОценка человеком: Самая гибкая и качественная, но медленная и дорогая. Избегайте, если возможно.
Оценка на основе LLM: Быстрая и гибкая, масштабируемая и подходящая для сложных суждений. Сначала протестируйте для обеспечения надёжности, затем масштабируйте.
Проведите мозговой штурм критериев успеха для вашего варианта использования с Claude на claude.ai.
Совет: Добавьте эту страницу в чат в качестве руководства для Claude!
Больше примеров кода для оценок, выставляемых людьми, кодом и LLM.
Was this page helpful?