跳到内容
·作者: AI Resource Hub Team

如何评估 LLM 应用:指标、工具和最佳实践

衡量 LLM 驱动应用的质量、可靠性和安全性的全面指南。

为什么评估重要

与传统软件不同,LLM 应用的输出是非确定性的。你不能只写单元测试——需要系统化评估。

关键指标

  • 准确性:输出是否匹配预期答案?
  • 相关性:回答是否切题且有用?
  • 忠实度:回答是否忠于提供的上下文?
  • 毒性:输出是否包含有害内容?
  • 延迟:生成需要多长时间?
  • 成本:每次请求的成本是多少?

评估方法

  • 人工评估:金标准但缓慢昂贵。
  • LLM 作为裁判:用强模型(GPT-4、Claude)评分输出。
  • 自动指标:BLEU、ROUGE 用于摘要;pass@k 用于代码。
  • A/B 测试:用真实用户比较两个版本。

工具

  • RAGAS:评估 RAG 管道。
  • DeepEval:开源 LLM 评估框架,14+ 指标。
  • LangSmith:LangChain 的追踪和评估平台。
  • Braintrust:AI 产品评估和可观测性。

最佳实践

  • 构建 100-500 个覆盖边界情况的评估数据集。
  • 每次提示词变更时运行评估。
  • 在仪表板中追踪指标变化。
  • 设置质量门禁:分数低于阈值时阻止部署。
评估质量