跳到正文
热点事件持续更新

Jev与Laya模型在Agent决策中的配对评估与自我审计

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026年10月5日,Jev与Laya发布论文,对开源权重模型Laya和托管模型Jev进行配对及自我审计评估。测试涵盖11个Agent决策点,数据源自18个公共来源共13,923个基础案例及鲁棒性变体。结果显示Jev在9个决策点上准确率显著高于Laya,提升幅度为10.8至46.0个百分点。但在零样本模型路由任务中两者均未超过随机水平,且在RAG相关性门控上打平。深入分析发现Laya存在严重的不稳定性,当选项顺序变化时表现波动剧烈。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv cs.CR精选
    Jev 与 Laya 在 Agent 决策点上的配对评估显示前者显著更准但存在自身审计误差

    该论文对开源权重模型 Laya 和托管模型 Jev 进行了配对且自我审计的评估,测试其在 11 个 Agent 决策点上的表现,数据源自 18 个公共来源共 13,923 个基础案例及鲁棒性变体。结果显示 Jev 在 9 个决策点上准确率显著高于 Laya,提升幅度为 10.8 至 46.0 个百分点,但在零样本模型路由任务中两者均未超过随机水平,且在 RAG 相关性门控上打平。 深入分析发现 Laya 存在严重的不稳定性,当选项顺序反转时其答案改变率达 30%,且在候选工具数量增加或相似度高时性能急剧下降,50 个最近邻工具场景下正确率仅为 31%,而 Jev 在唯一正确工具项上保持 98%。作者同时审计了自身评估流程,指出三个分析错误和一个设计混淆因素扭曲了原本的宣传结论:遗漏预筛选成本导致报告的 23.9% 节省被修正为实际的 4.3%,将门控准确率误作端到端质量(58% vs 98%),以及样本内阈值导致的保留集漏检率从目标 5% 升至 17%。此外,注入误报的“通道效应”在采用通道原生内容后消失。 事实层面确认了 Jev 在特定决策任务上的优势及 Laya 对输入顺序和候选数量的敏感性;推断表明当前系统 1 模型在复杂 Agent 编排中的实际成本节约可能远低于理论预期,且需警惕评估方法本身引入的偏差;猜测部分认为若无法解决 Laya 的排序敏感性问题,其在大规模工具调用场景下的部署风险较高。所有原始输出、代码及数据已公开以支持复现。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。