arXiv cs.AI· Katrina Drozdov, Oliver Chen, Langston Nashold, Rayan Krishnan·· 13 小时前AI 评分68
Legal Research Bench 评估显示最强模型在长周期法律任务中全对率不足四成
Legal Research Bench: Measuring End-to-End Reliability in Long-Horizon Legal Research Agents
AI 摘要
该论文发布 Legal Research Bench (LRB) 基准,包含 413 个由专家编写的开放式美国法律问题及金标准答案,旨在衡量端到端法律研究 Agent 的可靠性。评估结果显示,即使是表现最强的 Claude Opus 4.8 模型,在所有测试问题中的完全正确率仅为 42.9%。这意味着在需要识别管辖权、验证引用有效性并综合冲突法规的复杂场景中,当前前沿模型仍无法保证单一错误不会导致结果不可用。
研究团队采用全通过(all-pass)评分机制,要求响应必须满足所有标准且引用的权威来源经验证无误才算正确。实验发现,增加对话轮数、工具调用次数或推理成本并未带来准确率的提升。此外,性能在不同法律领域间差异显著,特别是在需要调和相互冲突的权威来源时,通过率进一步下降。LLM 裁判经过执业律师验证,其评分与人类判断高度一致。
事实层面,LRB 基准已公开,13 个前沿模型在特定设置下被评估。推断层面,单纯堆叠推理步骤或调用更多工具并非解决长周期任务可靠性的有效路径,核心瓶颈可能在于检索与验证机制而非生成能力。猜测层面,若要将此类 Agent 投入实际法律工作流,必须引入更严格的中间验证层,否则目前的技术水平尚不足以支撑自动化决策。
来源:arXiv cs.AI · arxiv.org