Aller au contenu

RAG (génération augmentée par récupération)

Technique qui récupère des documents pertinents dans une base de connaissances et les fournit au modèle pour qu’il réponde en s’appuyant sur vos données.

Le pipeline classique : découper les documents en fragments, les indexer sous forme d’embeddings dans une base vectorielle, récupérer les fragments les plus proches de la requête, puis les fournir au LLM comme contexte. Cela limite les hallucinations et garde les réponses à jour sans réentraînement.

Ressources associées