Der Aufbau einer erfolgreichen LLM-basierten Anwendung beginnt damit, deine Erfolgskriterien klar zu definieren und anschließend Evaluierungen zu entwerfen, um die Leistung daran zu messen. Dieser Zyklus ist zentral für Prompt-Engineering.

Gute Erfolgskriterien sind:
Spezifisch: Definiere klar, was du erreichen möchtest. Statt „gute Leistung" gib „genaue Sentiment-Klassifizierung" an.
Messbar: Verwende quantitative Metriken oder klar definierte qualitative Skalen. Zahlen bieten Klarheit und Skalierbarkeit, aber qualitative Maße können wertvoll sein, wenn sie konsistent zusammen mit quantitativen Maßen angewendet werden.
| Sicherheitskriterien | |
|---|---|
| Schlecht | Sichere Ausgaben |
| Gut | Weniger als 0,1 % der Ausgaben aus 10.000 Versuchen werden von unserem Inhaltsfilter als toxisch markiert. |
Erreichbar: Stütze deine Ziele auf Branchen-Benchmarks, frühere Experimente, KI-Forschung oder Expertenwissen. Deine Erfolgsmetriken sollten im Hinblick auf die Fähigkeiten aktueller Frontier-Modelle nicht unrealistisch sein.
Relevant: Richte deine Kriterien am Zweck deiner Anwendung und den Bedürfnissen der Nutzer aus. Eine hohe Zitiergenauigkeit kann für medizinische Apps entscheidend sein, für lockere Chatbots jedoch weniger.
Hier sind einige Kriterien, die für deinen Anwendungsfall wichtig sein könnten. Diese Liste ist nicht abschließend.
Die meisten Anwendungsfälle erfordern eine mehrdimensionale Evaluierung anhand mehrerer Erfolgskriterien.
Bei der Entscheidung, welche Methode zur Bewertung von Evals verwendet werden soll, wähle die schnellste, zuverlässigste und am besten skalierbare Methode:
Code-basierte Bewertung: Am schnellsten und zuverlässigsten, extrem skalierbar, aber es fehlt an Nuancen für komplexere Beurteilungen, die weniger regelbasierte Starrheit erfordern.
output == golden_answerkey_phrase in outputMenschliche Bewertung: Am flexibelsten und von hoher Qualität, aber langsam und teuer. Nach Möglichkeit vermeiden.
LLM-basierte Bewertung: Schnell und flexibel, skalierbar und geeignet für komplexe Beurteilungen. Teste zuerst die Zuverlässigkeit und skaliere dann.
Brainstorme Erfolgskriterien für deinen Anwendungsfall mit Claude auf claude.ai.
Tipp: Füge diese Seite als Leitfaden für Claude in den Chat ein!
Weitere Codebeispiele für von Menschen, Code und LLMs bewertete Evals.
Was this page helpful?