Pourquoi l’évaluation est importante

Contrairement aux logiciels traditionnels, les applications LLM ont des sorties non déterministes. On ne peut pas simplement écrire des tests unitaires — il faut une évaluation systématique.

Indicateurs clés

  • Précision : Le résultat correspond-il à la réponse attendue ?
  • Pertinence : La réponse est-elle pertinente et utile ?
  • Fidélité : La réponse reste-t-elle dans le contexte fourni ?
  • Toxicité : Le résultat contient-il un contenu nuisible ?
  • Latence : Combien de temps prend la génération ?
  • Coût : Quel est le coût par demande ?

Approches d’évaluation

  • Évaluation humaine : Référence d’excellence mais lente et coûteuse.
  • LLM-as-juge : Utiliser un modèle fort (GPT-5, Claude) pour noter les sorties.
  • Métriques automatisées : BLEU, ROUGE pour résumé ; pass@k pour le code.
  • Test A/B : Comparer deux versions avec de vrais utilisateurs.

Outils

  • RAGAS : Évalue les pipelines RAG (fidélité, pertinence, rappel).
  • DeepEval : cadre d’évaluation de LLM open source avec 14+ métriques.
  • LangSmith : plateforme de traçage et d’évaluation développée par LangChain.
  • Braintrust : Évaluation et observabilité des produits d’IA.

Meilleures pratiques

  • Constituer un jeu de données d’évaluation de 100 à 500 exemples couvrant des cas limites.
  • Effectuer des évaluations à chaque changement de prompt.
  • Suivre les métriques dans le temps dans un tableau de bord.
  • Définir des portes de qualité : bloquez les déploiements si les scores passent sous le seuil.