LitigationBench:面向诉讼业务的大模型基准
2026 年 7 月 23 日,法律科技公司 Litco 在 Show HN 公布 LitigationBench。
评测方法论
| 维度 | 内容 |
|---|---|
| 领域 | 诉讼业务(litigation work) |
| 设定 | 同一任务跑两次:无护栏 vs Litco 生产 Agent 内启用护栏 |
| 公开内容 | 两个分数、两者差距、全部失败案例(含产品内失败) |
| 关键指标 | composite 质量分、罚分前后对比 |
关注的高风险缺陷
- 编造权威判例(fabricated authorities)
- 基于虚假前提(false premises)
方法论价值
不只给单一分数,而是量化「安全护栏的实际收益与代价」,并罕见地公开自家产品内模型的失败,把「安全是否有用」从口号变成可核验数据。
行业背景
结合 DOJ 被曝引用 AI 生成假案例的争议,法律 AI 的事实可靠性正成为监管与公众关注焦点。
AI Master 解读
核心事件
Litco 发布 LitigationBench,以「同一任务跑两次(无护栏 vs 有护栏)」的方式评测大模型在诉讼业务上的表现,并透明公开差距与全部失败案例。
行业影响
法律是高风险、强事实的领域,模型「编造权威判例(fabricated authorities)」和「基于虚假前提(false premises)」是致命缺陷。LitigationBench 的方法论亮点在于:不只给单一分数,而是并列呈现「无安全护栏」与「在 Litco 生产 Agent 内启用护栏」两种设定下的成绩,让读者直观看到安全机制带来的实际收益与代价(含罚分前后的 composite 分数)。更罕见的是,它连自家产品内模型的失败也一并公开。
这种「把护栏效果量化并公开失败」的评测范式,对 AI 落地高合规行业有示范意义:它把「安全是否真的有用」从口号变成可核验的数据,也倒逼厂商正视模型在法律等专业场景的可靠性短板。结合近期 DOJ 被曝引用 AI 生成假案例的争议,法律 AI 的事实可靠性正成为监管与公众关注焦点。
AI Master 建议
法律/合规团队可参考该基准评估模型事实可靠性;关注「有无护栏」差距指标,作为选型时衡量安全机制实际价值的量化依据。
