Warum Bewertung wichtig ist

Im Gegensatz zu herkömmlicher Software haben LLM-Anwendungen nichtdeterministische Ausgaben. Man kann nicht einfach Unit-Tests schreiben – man braucht eine systematische Evaluation.

Wichtige Kennzahlen

  • Genauigkeit: Entspricht das Ergebnis der erwarteten Antwort?
  • Relevanz: Ist die Antwort thematisch und nützlich?
  • Treue: Bleibt die Antwort im gegebenen Kontext?
  • Toxizität: Enthält das Ergebnis schädliche Inhalte?
  • Latenz: Wie lange dauert die Erzeugung?
  • Kosten: Wie hoch sind die Kosten pro Anfrage?

Bewertungsansätze

  • Menschliche Bewertung: Goldstandard, aber langsam und teuer.
  • LLM-als-Richter: Verwende ein starkes Modell (GPT-5, Claude) zur Bewertung der Ergebnisse.
  • Automatisierte Metriken: BLEU, ROUGE für Zusammenfassungen; pass@k für Code.
  • A/B-Test: Vergleiche zwei Versionen mit echten Nutzern.

Werkzeuge

  • RAGAS: Bewertet RAG-Pipelines (Treue, Relevanz, Abruf).
  • DeepEval: Open-Source-LLM-Bewertungsrahmen mit 14+ Metriken.
  • LangSmith: Verfolgungs- und Bewertungsplattform von LangChain.
  • Braintrust: Bewertung und Beobachtbarkeit von KI-Produkten.

Best Practices

  • Erstelle einen Eval-Datensatz mit 100–500 Beispielen, die Randfälle abdecken.
  • Führe Bewertungen bei jeder Änderung des Prompts durch.
  • Verfolge Kennzahlen über die Zeit in einem Dashboard.
  • Setze Qualitätsgatter: Blockieren von Deployments, wenn die Werte unter die Schwelle fallen.