Pourquoi l’évaluation est importante
Contrairement aux logiciels traditionnels, les applications LLM ont des sorties non déterministes. On ne peut pas simplement écrire des tests unitaires — il faut une évaluation systématique.
Indicateurs clés
- Précision : Le résultat correspond-il à la réponse attendue ?
- Pertinence : La réponse est-elle pertinente et utile ?
- Fidélité : La réponse reste-t-elle dans le contexte fourni ?
- Toxicité : Le résultat contient-il un contenu nuisible ?
- Latence : Combien de temps prend la génération ?
- Coût : Quel est le coût par demande ?
Approches d’évaluation
- Évaluation humaine : Référence d’excellence mais lente et coûteuse.
- LLM-as-juge : Utiliser un modèle fort (GPT-5, Claude) pour noter les sorties.
- Métriques automatisées : BLEU, ROUGE pour résumé ; pass@k pour le code.
- Test A/B : Comparer deux versions avec de vrais utilisateurs.
Outils
- RAGAS : Évalue les pipelines RAG (fidélité, pertinence, rappel).
- DeepEval : cadre d’évaluation de LLM open source avec 14+ métriques.
- LangSmith : plateforme de traçage et d’évaluation développée par LangChain.
- Braintrust : Évaluation et observabilité des produits d’IA.
Meilleures pratiques
- Constituer un jeu de données d’évaluation de 100 à 500 exemples couvrant des cas limites.
- Effectuer des évaluations à chaque changement de prompt.
- Suivre les métriques dans le temps dans un tableau de bord.
- Définir des portes de qualité : bloquez les déploiements si les scores passent sous le seuil.