·作者: AI Resource Hub Team
如何评估 LLM 应用:指标、工具和最佳实践
衡量 LLM 驱动应用的质量、可靠性和安全性的全面指南。
为什么评估重要
与传统软件不同,LLM 应用的输出是非确定性的。你不能只写单元测试——需要系统化评估。
关键指标
- 准确性:输出是否匹配预期答案?
- 相关性:回答是否切题且有用?
- 忠实度:回答是否忠于提供的上下文?
- 毒性:输出是否包含有害内容?
- 延迟:生成需要多长时间?
- 成本:每次请求的成本是多少?
评估方法
- 人工评估:金标准但缓慢昂贵。
- LLM 作为裁判:用强模型(GPT-4、Claude)评分输出。
- 自动指标:BLEU、ROUGE 用于摘要;pass@k 用于代码。
- A/B 测试:用真实用户比较两个版本。
工具
- RAGAS:评估 RAG 管道。
- DeepEval:开源 LLM 评估框架,14+ 指标。
- LangSmith:LangChain 的追踪和评估平台。
- Braintrust:AI 产品评估和可观测性。
最佳实践
- 构建 100-500 个覆盖边界情况的评估数据集。
- 每次提示词变更时运行评估。
- 在仪表板中追踪指标变化。
- 设置质量门禁:分数低于阈值时阻止部署。
评估质量