Por qué importa la evaluación
A diferencia del software tradicional, las aplicaciones LLM tienen salidas no deterministas. No puedes simplemente escribir pruebas unitarias — necesitas una evaluación sistemática.
Métricas clave
- Precisión: ¿Coincide la salida con la respuesta esperada?
- Relevancia: ¿La respuesta es relevante y útil?
- Fidelidad: ¿La respuesta se ciñe al contexto proporcionado?
- Toxicidad: ¿Contiene contenido dañino el resultado?
- Latencia: ¿Cuánto tarda la generación?
- Coste: ¿Cuál es el coste por solicitud?
Enfoques de evaluación
- Evaluación humana: Estándar de oro pero lenta y cara.
- LLM-como-juez: Utiliza un modelo fuerte (GPT-5, Claude) para calificar las salidas.
- Métricas automatizadas: BLEU, ROUGE para resumen; pass@k para el código.
- Pruebas A/B: Comparar dos versiones con usuarios reales.
Herramientas
- RAGAS: Evalúa los pipelines RAG (fidelidad, relevancia, exhaustividad).
- DeepEval: Marco de evaluación de LLM de código abierto con 14+ métricas.
- LangSmith: Plataforma de rastreo y evaluación de LangChain.
- Braintrust: Evaluación y observabilidad para productos de IA.
Mejores prácticas
- Construir un conjunto de datos de evaluación de 100-500 ejemplos que cubran casos límite.
- Realizar evaluaciones en cada cambio de prompt.
- Rastrear métricas a lo largo del tiempo en un panel de control.
- Establecer puertas de calidad: bloquea el despliegue si las puntuaciones caen por debajo del umbral.