Warum Bewertung wichtig ist
Im Gegensatz zu herkömmlicher Software haben LLM-Anwendungen nichtdeterministische Ausgaben. Man kann nicht einfach Unit-Tests schreiben – man braucht eine systematische Evaluation.
Wichtige Kennzahlen
- Genauigkeit: Entspricht das Ergebnis der erwarteten Antwort?
- Relevanz: Ist die Antwort thematisch und nützlich?
- Treue: Bleibt die Antwort im gegebenen Kontext?
- Toxizität: Enthält das Ergebnis schädliche Inhalte?
- Latenz: Wie lange dauert die Erzeugung?
- Kosten: Wie hoch sind die Kosten pro Anfrage?
Bewertungsansätze
- Menschliche Bewertung: Goldstandard, aber langsam und teuer.
- LLM-als-Richter: Verwende ein starkes Modell (GPT-5, Claude) zur Bewertung der Ergebnisse.
- Automatisierte Metriken: BLEU, ROUGE für Zusammenfassungen; pass@k für Code.
- A/B-Test: Vergleiche zwei Versionen mit echten Nutzern.
Werkzeuge
- RAGAS: Bewertet RAG-Pipelines (Treue, Relevanz, Abruf).
- DeepEval: Open-Source-LLM-Bewertungsrahmen mit 14+ Metriken.
- LangSmith: Verfolgungs- und Bewertungsplattform von LangChain.
- Braintrust: Bewertung und Beobachtbarkeit von KI-Produkten.
Best Practices
- Erstelle einen Eval-Datensatz mit 100–500 Beispielen, die Randfälle abdecken.
- Führe Bewertungen bei jeder Änderung des Prompts durch.
- Verfolge Kennzahlen über die Zeit in einem Dashboard.
- Setze Qualitätsgatter: Blockieren von Deployments, wenn die Werte unter die Schwelle fallen.