Pourquoi RAG compte

La génération augmentée par la récupération (RAG) est la manière la plus pratique de fonder les réponses des LLM dans vos propres données. Mais construire un système prêt pour la production nécessite plus que la simple connexion d’une base de données vectorielle.

Stratégies de fragmentation

  • Taille fixe : Simple mais peut diviser les unités sémantiques.
  • Sémantique : Scindé par signification en utilisant la similarité d’immersion.
  • Récursive : Divisée par en-têtes, paragraphes, puis phrases.
  • Document-aware : Respecter la structure Markdown/HTML.

Recherche hybride

Combinez la recherche vectorielle dense avec la recherche par mots-clés clairsemées (BM25). Cela permet de détecter à la fois les correspondances sémantiques et les correspondances de termes exacts.

Reclassement

Après la récupération initiale, utilisez un modèle cross-encoder pour réévaluer les résultats. Cela améliore considérablement la précision.

Évaluation

  • Fidélité : La réponse reste-t-elle dans le contexte récupéré ?
  • Pertinence : Les chunks récupérés sont-ils vraiment utiles ?
  • Correction de la réponse : La réponse finale est-elle factuellement correcte ?

Outils et cadres

  • LlamaIndex : cadre RAG de haut niveau avec recettes intégrées.
  • LangChain : Couche d’orchestration flexible.
  • RAGAS : Cadre d’évaluation conçu sur un effet.
  • Chroma / Qdrant / Weaviate : Bases de données vectorielles avec différents compromis.