Claude Platform Docs
Best PracticesTesten und evaluieren

Erfolgskriterien definieren und Evaluierungen erstellen

Definiere messbare Erfolgskriterien für deine LLM-Anwendung und erstelle Evaluierungen, um sie zu testen – von Exact-Match-Prüfungen bis hin zu LLM-basierter Bewertung.

Der Aufbau einer erfolgreichen LLM-basierten Anwendung beginnt damit, deine Erfolgskriterien klar zu definieren und anschließend Evaluierungen zu entwerfen, mit denen du die Leistung anhand dieser Kriterien messen kannst. Dieser Zyklus ist zentral für das „prompt engineering“ (Prompt-Engineering).

Flussdiagramm des Prompt-Engineerings: Testfälle (test cases), vorläufiger Prompt (preliminary prompt), iteratives Testen und Verfeinern (iterative testing and refinement), abschließende Validierung (final validation), Auslieferung (ship)

Definiere deine Erfolgskriterien

Gute Erfolgskriterien sind:

  • Spezifisch: Definiere klar, was du erreichen möchtest. Statt „gute Leistung“ gib „genaue Sentiment-Klassifizierung“ an.

  • Messbar: Verwende quantitative Metriken oder klar definierte qualitative Skalen. Zahlen bieten Klarheit und Skalierbarkeit, aber qualitative Maße können wertvoll sein, wenn sie konsistent zusammen mit quantitativen Maßen angewendet werden.

    • Selbst „unscharfe“ Themen wie Ethik und Sicherheit lassen sich quantifizieren:
      Sicherheitskriterien
      SchlechtSichere Ausgaben
      GutWeniger als 0,1 % der Ausgaben aus 10.000 Durchläufen werden vom Inhaltsfilter als toxisch markiert.

  • Erreichbar: Stütze deine Ziele auf Branchen-Benchmarks, frühere Experimente, KI-Forschung oder Expertenwissen. Deine Erfolgsmetriken sollten angesichts der aktuellen Fähigkeiten von Frontier-Modellen nicht unrealistisch sein.

  • Relevant: Richte deine Kriterien am Zweck deiner Anwendung und an den Bedürfnissen der Nutzer aus. Eine hohe Zitiergenauigkeit kann für medizinische Apps entscheidend sein, für lockere Chatbots jedoch weniger.

Häufige Erfolgskriterien

Hier sind einige Kriterien, die für deinen Anwendungsfall wichtig sein könnten. Diese Liste ist nicht vollständig.

Die meisten Anwendungsfälle erfordern eine mehrdimensionale Evaluierung anhand mehrerer Erfolgskriterien.


Evaluierungen erstellen

Prinzipien für das Eval-Design

  1. Sei aufgabenspezifisch: Entwirf Evals, die deine reale Aufgabenverteilung widerspiegeln. Vergiss nicht, Grenzfälle einzubeziehen!

  2. Automatisiere, wenn möglich: Strukturiere Fragen so, dass eine automatisierte Bewertung möglich ist (zum Beispiel Multiple-Choice, String-Match, Code-bewertet, LLM-bewertet).
  3. Priorisiere Menge vor Qualität: Mehr Fragen mit automatisierter Bewertung von etwas geringerer Aussagekraft sind besser als weniger Fragen mit hochwertigen, von Menschen handbewerteten Evals.

Beispiel-Evals


Bewerte deine Evaluierungen

Wenn du entscheidest, mit welcher Methode du Evals bewertest, wähle die schnellste, zuverlässigste und am besten skalierbare Methode:

  1. Code-basierte Bewertung: Am schnellsten und zuverlässigsten, extrem skalierbar, aber es fehlt ihr an Nuancen für komplexere Beurteilungen, die weniger regelbasierte Starrheit erfordern.

    • Exact Match: output == golden_answer
    • String-Match: key_phrase in output
  2. Menschliche Bewertung: Am flexibelsten und von höchster Qualität, aber langsam und teuer. Wenn möglich vermeiden.

  3. LLM-basierte Bewertung: Schnell und flexibel, skalierbar und für komplexe Beurteilungen geeignet. Teste zuerst die Zuverlässigkeit und skaliere dann.

Tipps für LLM-basierte Bewertung

  • Verwende detaillierte, klare Rubriken: „Die Antwort sollte im ersten Satz immer ‚Acme Inc.' erwähnen. Tut sie das nicht, wird die Antwort automatisch als ‚falsch' bewertet.“
  • Empirisch oder spezifisch: Weise das LLM zum Beispiel an, nur ‚correct' oder ‚incorrect' auszugeben oder auf einer Skala von 1–5 zu urteilen. Rein qualitative Evaluierungen lassen sich nur schwer schnell und in großem Umfang bewerten.
  • Fördere das Schlussfolgern: Bitte das LLM, zuerst zu schlussfolgern, bevor es einen Evaluierungsscore ausgibt, und verwirf dann die Schlussfolgerung. Das erhöht die Evaluierungsleistung, insbesondere bei Aufgaben, die komplexe Beurteilungen erfordern.

Nächste Schritte

Brainstorme mit Claude auf claude.ai Erfolgskriterien für deinen Anwendungsfall.

Tipp: Füge diese Seite als Orientierung für Claude in den Chat ein!

Weitere Codebeispiele für von Menschen, per Code und per LLM bewertete Evals.

Was this page helpful?