Claude Platform Docs
Лучшие практикиТестирование и оценка

Определение критериев успеха и создание оценок

Определите измеримые критерии успеха для вашего LLM-приложения и создайте оценки для его тестирования — от проверок на точное совпадение до оценивания на основе LLM.

Создание успешного приложения на основе «large language model» (большой языковой модели), или LLM, начинается с чёткого определения критериев успеха и последующей разработки оценок для измерения производительности относительно них. Этот цикл занимает центральное место в «prompt engineering» (инженерии подсказок).

Блок-схема инженерии подсказок: test cases (тестовые случаи), preliminary prompt (предварительная подсказка), iterative testing and refinement (итеративное тестирование и доработка), final validation (финальная проверка), ship (выпуск)

Определите критерии успеха

Хорошие критерии успеха:

  • Конкретные: Чётко определите, чего вы хотите достичь. Вместо «хорошей производительности» укажите «точную классификацию тональности».

  • Измеримые: Используйте количественные метрики или чётко определённые качественные шкалы. Числа обеспечивают ясность и масштабируемость, но качественные показатели могут быть ценными, если применяются последовательно вместе с количественными.

    • Даже «размытые» темы, такие как этика и безопасность, можно выразить количественно:
      Критерии безопасности
      ПлохоБезопасные выходные данные
      ХорошоМенее 0,1% выходных данных из 10 000 испытаний помечены фильтром контента как токсичные.

  • Достижимые: Основывайте свои цели на отраслевых бенчмарках, предыдущих экспериментах, исследованиях в области ИИ или экспертных знаниях. Ваши метрики успеха не должны быть нереалистичными по отношению к текущим возможностям передовых моделей.

  • Релевантные: Согласуйте критерии с назначением вашего приложения и потребностями пользователей. Высокая точность цитирования может быть критически важна для медицинских приложений, но менее важна для неформальных чат-ботов.

Распространённые критерии успеха

Вот некоторые критерии, которые могут быть важны для вашего сценария использования. Этот список не является исчерпывающим.

Большинство сценариев использования требуют многомерной оценки по нескольким критериям успеха.


Создайте оценки

Принципы разработки оценок

  1. Ориентируйтесь на задачу: Разрабатывайте оценки, отражающие реальное распределение ваших задач. Не забудьте учесть граничные случаи!

  2. Автоматизируйте, когда это возможно: Структурируйте вопросы так, чтобы их можно было оценивать автоматически (например, множественный выбор, совпадение строк, оценивание кодом, оценивание с помощью LLM).
  3. Отдавайте приоритет объёму, а не качеству: Больше вопросов с автоматическим оцениванием чуть более низкого качества сигнала лучше, чем меньше вопросов с высококачественными оценками, выставленными вручную человеком.

Примеры оценок


Оценивайте результаты ваших оценок

Решая, какой метод использовать для выставления оценок, выбирайте самый быстрый, надёжный и масштабируемый метод:

  1. Оценивание на основе кода: Самое быстрое и надёжное, чрезвычайно масштабируемое, но ему не хватает нюансов для более сложных суждений, требующих меньшей жёсткости правил.

    • Точное совпадение: output == golden_answer
    • Совпадение строки: key_phrase in output
  2. Оценивание человеком: Наиболее гибкое и качественное, но медленное и дорогое. По возможности избегайте.

  3. Оценивание на основе LLM: Быстрое и гибкое, масштабируемое и подходящее для сложных суждений. Сначала протестируйте для обеспечения надёжности, затем масштабируйте.

Советы по оцениванию на основе LLM

  • Используйте подробные, чёткие рубрики: «В ответе всегда должна упоминаться 'Acme Inc.' в первом предложении. Если это не так, ответ автоматически оценивается как 'неправильный'».
  • Эмпирические или конкретные: Например, проинструктируйте LLM выводить только 'correct' или 'incorrect' либо оценивать по шкале от 1 до 5. Чисто качественные оценки трудно анализировать быстро и в масштабе.
  • Поощряйте рассуждение: Попросите LLM сначала порассуждать, прежде чем выдать оценочный балл, а затем отбросьте рассуждение. Это повышает качество оценки, особенно для задач, требующих сложных суждений.

Следующие шаги

Проведите мозговой штурм критериев успеха для вашего сценария использования вместе с Claude на claude.ai.

Совет: Добавьте эту страницу в чат в качестве руководства для Claude!

Больше примеров кода оценок, выставляемых человеком, кодом и LLM.

Was this page helpful?