Legal Research Bench 评估显示法律 Agent 全对率不足四成
先了解这件事
2026年10月2日,研究团队发布 Legal Research Bench (LRB) 基准,包含413个由专家编写的开放式美国法律问题及金标准答案,旨在衡量端到端法律研究 Agent 的可靠性。评估结果显示,即使是表现最强的 Claude Opus 4.8 模型,在所有测试问题中的完全正确率仅为 42.9%。这表明在需要识别管辖权、验证引用有效性并综合冲突法规的复杂场景中,当前前沿模型仍无法保证单一错误不会导致结果不可用。
AI 根据报道生成 · 3 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv cs.AILegal Research Bench 评估显示最强模型在长周期法律任务中全对率不足四成
该论文发布 Legal Research Bench (LRB) 基准,包含 413 个由专家编写的开放式美国法律问题及金标准答案,旨在衡量端到端法律研究 Agent 的可靠性。评估结果显示,即使是表现最强的 Claude Opus 4.8 模型,在所有测试问题中的完全正确率仅为 42.9%。这意味着在需要识别管辖权、验证引用有效性并综合冲突法规的复杂场景中,当前前沿模型仍无法保证单一错误不会导致结果不可用。 研究团队采用全通过(all-pass)评分机制,要求响应必须满足所有标准且引用的权威来源经验证无误才算正确。实验发现,增加对话轮数、工具调用次数或推理成本并未带来准确率的提升。此外,性能在不同法律领域间差异显著,特别是在需要调和相互冲突的权威来源时,通过率进一步下降。LLM 裁判经过执业律师验证,其评分与人类判断高度一致。 事实层面,LRB 基准已公开,13 个前沿模型在特定设置下被评估。推断层面,单纯堆叠推理步骤或调用更多工具并非解决长周期任务可靠性的有效路径,核心瓶颈可能在于检索与验证机制而非生成能力。猜测层面,若要将此类 Agent 投入实际法律工作流,必须引入更严格的中间验证层,否则目前的技术水平尚不足以支撑自动化决策。
本事件热度走势
当前热度 7·可比范围峰值 7(10月2日 23:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。