Loading...
    • Руководство разработчика
    • Справочник API
    • MCP
    • Ресурсы
    • Примечания к выпуску
    Search...
    ⌘K
    Первые шаги
    Введение в ClaudeБыстрый старт
    Модели и цены
    Обзор моделейВыбор моделиЧто нового в Claude 4.5Миграция на Claude 4.5Устаревшие моделиЦены
    Разработка с Claude
    Обзор функцийИспользование Messages APIКонтекстные окнаЛучшие практики промптирования
    Возможности
    Кэширование промптовРедактирование контекстаРасширенное мышлениеУсилиеПотоковая передача сообщенийПакетная обработкаЦитированияМногоязычная поддержкаПодсчет токеновEmbeddingsЗрениеПоддержка PDFFiles APIРезультаты поискаСтруктурированные выходные данные
    Инструменты
    ОбзорКак реализовать использование инструментовПотоковая передача инструментов с детализациейИнструмент BashИнструмент выполнения кодаПрограммное вызывание инструментовИнструмент управления компьютеромИнструмент текстового редактораИнструмент веб-выборкиИнструмент веб-поискаИнструмент памятиИнструмент поиска инструментов
    Agent Skills
    ОбзорБыстрый стартЛучшие практикиИспользование Skills с API
    Agent SDK
    ОбзорБыстрый стартTypeScript SDKTypeScript V2 (preview)Python SDKРуководство по миграции
    MCP в API
    MCP коннекторУдаленные MCP серверы
    Claude на сторонних платформах
    Amazon BedrockMicrosoft FoundryVertex AI
    Инженерия промптов
    ОбзорГенератор промптовИспользование шаблонов промптовУлучшитель промптовБудьте ясны и прямолинейныИспользуйте примеры (многошаговое промптирование)Дайте Claude подумать (CoT)Используйте XML-тегиДайте Claude роль (системные промпты)Предзаполните ответ ClaudeЦепочка сложных промптовСоветы по длинному контекстуСоветы по расширенному мышлению
    Тестирование и оценка
    Определение критериев успехаРазработка тестовых случаевИспользование инструмента оценкиСнижение задержки
    Усиление защиты
    Снижение галлюцинацийПовышение согласованности выходных данныхСмягчение взломовПотоковые отказыСнижение утечки промптовДержите Claude в образе
    Администрирование и мониторинг
    Обзор Admin APIAPI использования и затратClaude Code Analytics API
    Console
    Log in
    Loading...
    Loading...
    Loading...
    Loading...
    Loading...
    Loading...
    Loading...
    Loading...
    Loading...
    Loading...
    Loading...
    Loading...
    Loading...
    Loading...
    Loading...
    Loading...

    Solutions

    • AI agents
    • Code modernization
    • Coding
    • Customer support
    • Education
    • Financial services
    • Government
    • Life sciences

    Partners

    • Amazon Bedrock
    • Google Cloud's Vertex AI

    Learn

    • Blog
    • Catalog
    • Courses
    • Use cases
    • Connectors
    • Customer stories
    • Engineering at Anthropic
    • Events
    • Powered by Claude
    • Service partners
    • Startups program

    Company

    • Anthropic
    • Careers
    • Economic Futures
    • Research
    • News
    • Responsible Scaling Policy
    • Security and compliance
    • Transparency

    Learn

    • Blog
    • Catalog
    • Courses
    • Use cases
    • Connectors
    • Customer stories
    • Engineering at Anthropic
    • Events
    • Powered by Claude
    • Service partners
    • Startups program

    Help and security

    • Availability
    • Status
    • Support
    • Discord

    Terms and policies

    • Privacy policy
    • Responsible disclosure policy
    • Terms of service: Commercial
    • Terms of service: Consumer
    • Usage policy
    Тестирование и оценка

    Определите критерии успеха

    Создание успешного приложения на основе LLM начинается с четкого определения критериев успеха. Как вы узнаете, когда ваше приложение достаточно хорошо для публикации?

    Наличие четких критериев успеха гарантирует, что ваши усилия по разработке промптов и оптимизации сосредоточены на достижении конкретных, измеримых целей.


    Создание надежных критериев

    Хорошие критерии успеха:

    • Конкретные: Четко определяют, чего вы хотите достичь. Вместо "хорошей производительности" укажите "точная классификация настроений".

    • Измеримые: Используйте количественные показатели или четко определенные качественные шкалы. Числа обеспечивают ясность и масштабируемость, но качественные меры могут быть ценными, если они последовательно применяются вместе с количественными мерами.

      • Даже "нечеткие" темы, такие как этика и безопасность, можно количественно оценить:
        Критерии безопасности
        ПлохоБезопасные результаты
        ХорошоМенее 0,1% результатов из 10 000 испытаний отмечены как токсичные нашим фильтром контента.

    • Достижимые: Основывайте свои цели на отраслевых эталонах, предыдущих экспериментах, исследованиях ИИ или экспертных знаниях. Ваши критерии успеха не должны быть нереалистичными для текущих возможностей передовых моделей.

    • Релевантные: Согласуйте ваши критерии с целью вашего приложения и потребностями пользователей. Точность цитирования может быть критически важной для медицинских приложений, но менее важной для повседневных чат-ботов.


    Общие критерии успеха, которые следует учитывать

    Вот некоторые критерии, которые могут быть важны для вашего случая использования. Этот список не является исчерпывающим.

    Большинство случаев использования потребуют многомерной оценки по нескольким критериям успеха.


    Следующие шаги

    Мозговой штурм критериев

    Проведите мозговой штурм критериев успеха для вашего случая использования с Claude на claude.ai.

    Совет: Добавьте эту страницу в чат в качестве руководства для Claude!

    Разработка оценок

    Узнайте, как создавать надежные тестовые наборы для оценки производительности Claude по вашим критериям.

    • Создание надежных критериев
    • Общие критерии успеха, которые следует учитывать
    • Следующие шаги