DeepEval
LLM 评估框架,15K+ stars。提供全面的 LLM 评估指标和测试框架,支持 RAG 评估、幻觉检测、毒性检测等,是 LLM 应用质量保证的标准工具
🎯适用场景:LLM 应用上线前的自动化质量评测与 RAG 效果验证
#LLM 评估#RAG 评估#幻觉检测#测试框架
📥 收录于 2026/5/27
📊 仓库数据
Stars17,805
Forks1,842
语言Python
更新2026/8/24
📈 Stars 变化 ↑3 天 +58· 统计区间 8/21 13:15 → 8/24 03:32(3 天)
✅ 优点
- •内置 RAG/幻觉/毒性等多类评估指标
- •可集成 pytest CI 做回归评测
- •Python API 简洁,上手快
- •15K+ stars 社区案例多
⚠️ 限制
- •LLM-as-Judge 成本需自行控制
- •复杂业务场景需自定义 metric
- •与生产监控体系需额外对接
- •评判模型选择影响结果稳定性
