Claude Platform Docs
Bonnes pratiquesTester et évaluer

Définir des critères de réussite et construire des évaluations

Définissez des critères de réussite mesurables pour votre application LLM et construisez des évaluations pour la tester, des vérifications de correspondance exacte à la notation basée sur un LLM.

La construction d'une application réussie basée sur un « large language model » (grand modèle de langage), ou LLM, commence par une définition claire de vos critères de réussite, puis par la conception d'évaluations permettant de mesurer les performances par rapport à ces critères. Ce cycle est au cœur du « prompt engineering » (ingénierie de prompts).

Organigramme du prompt engineering (ingénierie de prompts) : test cases (cas de test), preliminary prompt (prompt préliminaire), iterative testing and refinement (tests et affinage itératifs), final validation (validation finale), ship (mise en production)

Définir vos critères de réussite

De bons critères de réussite sont :

  • Spécifiques : Définissez clairement ce que vous voulez atteindre. Au lieu de « bonnes performances », précisez « classification précise des sentiments ».

  • Mesurables : Utilisez des métriques quantitatives ou des échelles qualitatives bien définies. Les chiffres apportent clarté et évolutivité, mais les mesures qualitatives peuvent être précieuses si elles sont appliquées de manière cohérente en complément des mesures quantitatives.

    • Même des sujets « flous » comme l'éthique et la sécurité peuvent être quantifiés :
      Critères de sécurité
      MauvaisSorties sûres
      BonMoins de 0,1 % des sorties sur 10 000 essais signalées pour toxicité par le filtre de contenu.

  • Atteignables : Fondez vos objectifs sur des références du secteur, des expériences antérieures, la recherche en IA ou des connaissances d'experts. Vos métriques de réussite ne doivent pas être irréalistes par rapport aux capacités actuelles des modèles de pointe.

  • Pertinents : Alignez vos critères sur l'objectif de votre application et les besoins des utilisateurs. Une grande exactitude des citations peut être essentielle pour des applications médicales, mais moins pour des chatbots informels.

Critères de réussite courants

Voici quelques critères qui pourraient être importants pour votre cas d'usage. Cette liste n'est pas exhaustive.

La plupart des cas d'usage nécessitent une évaluation multidimensionnelle selon plusieurs critères de réussite.


Construire des évaluations

Principes de conception des évaluations

  1. Soyez spécifique à la tâche : Concevez des évaluations qui reflètent la distribution réelle de vos tâches. N'oubliez pas de prendre en compte les cas limites !

  2. Automatisez lorsque c'est possible : Structurez les questions de façon à permettre une notation automatisée (par exemple, choix multiples, correspondance de chaînes, notation par code, notation par LLM).
  3. Privilégiez le volume à la qualité : Davantage de questions avec une notation automatisée au signal légèrement plus faible valent mieux que moins de questions avec des évaluations de haute qualité notées à la main par des humains.

Exemples d'évaluations


Noter vos évaluations

Lorsque vous décidez quelle méthode utiliser pour noter les évaluations, choisissez la méthode la plus rapide, la plus fiable et la plus évolutive :

  1. Notation par code : La plus rapide et la plus fiable, extrêmement évolutive, mais elle manque de nuance pour les jugements plus complexes qui exigent moins de rigidité fondée sur des règles.

    • Correspondance exacte : output == golden_answer
    • Correspondance de chaîne : key_phrase in output
  2. Notation humaine : La plus flexible et de la plus haute qualité, mais lente et coûteuse. À éviter si possible.

  3. Notation basée sur un LLM : Rapide et flexible, évolutive et adaptée aux jugements complexes. Testez d'abord pour garantir la fiabilité, puis passez à l'échelle.

Conseils pour la notation basée sur un LLM

  • Ayez des grilles détaillées et claires : « La réponse doit toujours mentionner "Acme Inc." dans la première phrase. Si ce n'est pas le cas, la réponse est automatiquement notée comme "incorrecte". »
  • Empirique ou spécifique : Par exemple, demandez au LLM de ne produire que « correct » ou « incorrect », ou de juger sur une échelle de 1 à 5. Les évaluations purement qualitatives sont difficiles à apprécier rapidement et à grande échelle.
  • Encouragez le raisonnement : Demandez au LLM de raisonner d'abord avant de produire un score d'évaluation, puis écartez le raisonnement. Cela améliore les performances d'évaluation, en particulier pour les tâches nécessitant un jugement complexe.

Prochaines étapes

Réfléchissez aux critères de réussite de votre cas d'usage avec Claude sur claude.ai.

Conseil : Déposez cette page dans le chat pour guider Claude !

Davantage d'exemples de code d'évaluations notées par des humains, par du code et par des LLM.

Was this page helpful?