Warum RAG wichtig ist
Retrieval-Augmented Generation (RAG) ist die praktischste Methode, um LLM-Antworten in eigenen Daten zu verankern. Aber ein produktionsbereites System zu bauen erfordert mehr als nur eine Vektordatenbank zu verbinden.
Chunking-Strategien
- Feste Größe: Einfach, kann semantische Einheiten aufteilen.
- Semantisch: Geteilt nach Bedeutung mittels Embeddingsähnlichkeit.
- Rekursiv: Aufgeteilt nach Überschriften, Absätzen und dann Sätzen.
- Dokumentenbewusst: Markdown-/HTML-Struktur respektieren.
Hybridsuche
Kombinieren Sie die dichte Vektorsuche mit der Suche nach sparsen Schlüsselwörtern (BM25). Dies erfasst sowohl semantische als auch exakte Begriffsübereinstimmungen.
Neubewertung
Nach der ersten Abruf verwenden Sie ein Cross-Encoder-Modell, um die Ergebnisse neu zu bewerten. Das verbessert die Präzision erheblich.
Bewertung
- Treue: Bleibt die Antwort im abgerufenen Kontext fest?
- Relevanz: Sind die abgerufenen Chunks tatsächlich nützlich?
- Antwort-Korrektheit: Ist die endgültige Antwort faktisch korrekt?
Werkzeuge & Frameworks
- LlamaIndex: Hochrangiges RAG-Framework mit integrierten Rezepten.
- LangChain: Flexible Orchestrierungsschicht.
- RAGAS: Speziell entwickelter Bewertungsrahmen.
- Chroma / Qdrant / Weaviate: Vektordatenbanken mit unterschiedlichen Kompromissen.