Por qué importa la evaluación

A diferencia del software tradicional, las aplicaciones LLM tienen salidas no deterministas. No puedes simplemente escribir pruebas unitarias — necesitas una evaluación sistemática.

Métricas clave

  • Precisión: ¿Coincide la salida con la respuesta esperada?
  • Relevancia: ¿La respuesta es relevante y útil?
  • Fidelidad: ¿La respuesta se ciñe al contexto proporcionado?
  • Toxicidad: ¿Contiene contenido dañino el resultado?
  • Latencia: ¿Cuánto tarda la generación?
  • Coste: ¿Cuál es el coste por solicitud?

Enfoques de evaluación

  • Evaluación humana: Estándar de oro pero lenta y cara.
  • LLM-como-juez: Utiliza un modelo fuerte (GPT-5, Claude) para calificar las salidas.
  • Métricas automatizadas: BLEU, ROUGE para resumen; pass@k para el código.
  • Pruebas A/B: Comparar dos versiones con usuarios reales.

Herramientas

  • RAGAS: Evalúa los pipelines RAG (fidelidad, relevancia, exhaustividad).
  • DeepEval: Marco de evaluación de LLM de código abierto con 14+ métricas.
  • LangSmith: Plataforma de rastreo y evaluación de LangChain.
  • Braintrust: Evaluación y observabilidad para productos de IA.

Mejores prácticas

  • Construir un conjunto de datos de evaluación de 100-500 ejemplos que cubran casos límite.
  • Realizar evaluaciones en cada cambio de prompt.
  • Rastrear métricas a lo largo del tiempo en un panel de control.
  • Establecer puertas de calidad: bloquea el despliegue si las puntuaciones caen por debajo del umbral.