Jev 与 Laya 在 Agent 决策点上的配对评估显示前者显著更准但存在自身审计误差
Fast Models, Slow Evidence: A Paired and Self-Audited Evaluation of System-1 Decision Models for LLM Agent Harnesses
该论文对开源权重模型 Laya 和托管模型 Jev 进行了配对且自我审计的评估,测试其在 11 个 Agent 决策点上的表现,数据源自 18 个公共来源共 13,923 个基础案例及鲁棒性变体。结果显示 Jev 在 9 个决策点上准确率显著高于 Laya,提升幅度为 10.8 至 46.0 个百分点,但在零样本模型路由任务中两者均未超过随机水平,且在 RAG 相关性门控上打平。
深入分析发现 Laya 存在严重的不稳定性,当选项顺序反转时其答案改变率达 30%,且在候选工具数量增加或相似度高时性能急剧下降,50 个最近邻工具场景下正确率仅为 31%,而 Jev 在唯一正确工具项上保持 98%。作者同时审计了自身评估流程,指出三个分析错误和一个设计混淆因素扭曲了原本的宣传结论:遗漏预筛选成本导致报告的 23.9% 节省被修正为实际的 4.3%,将门控准确率误作端到端质量(58% vs 98%),以及样本内阈值导致的保留集漏检率从目标 5% 升至 17%。此外,注入误报的“通道效应”在采用通道原生内容后消失。
事实层面确认了 Jev 在特定决策任务上的优势及 Laya 对输入顺序和候选数量的敏感性;推断表明当前系统 1 模型在复杂 Agent 编排中的实际成本节约可能远低于理论预期,且需警惕评估方法本身引入的偏差;猜测部分认为若无法解决 Laya 的排序敏感性问题,其在大规模工具调用场景下的部署风险较高。所有原始输出、代码及数据已公开以支持复现。
原文揭示的预筛成本漏算与通道效应等审计误差,能直接校正对系统1模型实际收益的估算。
来源:arXiv cs.CR · arxiv.org