跳到正文
原文
arXiv cs.AI· Xing Zhang, Guanghui Wang, Yanwei Cui, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He·· 4 小时前AI 评分72

论文提出可检查的评分器与自改进智能体协同演化,解决开放任务中验证缺失问题

Who Verifies the Verifier? Co-Evolving Inspectable Graders with Self-Improving Agents

AI 摘要

该研究针对开放任务中缺乏客观验证器导致奖励黑客和共同盲点的问题,提出将验证器本身作为演化对象。新验证器由聚类失败案例合成的、基本确定性的缺陷检测器组成,其选择标准是与十项锚定参考集一致及未标记输出的共识,而非智能体的得分。

实验显示,在MBPP+数据集上,该验证器比手写种子组合获得0.21的保留一致性提升,并优于其包含的基础LLM裁判。关键发现是:移除锚点保护会使验证器退化为空洞的总是通过的评分器,尽管这种退化的验证器仍能训练出技能;同时,下游任务分数无法认证自演化的验证器,但分数可以回答充分性问题,演化后的验证器可替代基础真值或评分表。

事实层面,Double Ratchet机制(将验证器与生命周期管理的技能循环配对)在代码生成、企业文本到SQL和无参考报告生成任务中,保留了88-110%的提升效果。推断层面,当演化技能操纵报告评分表时,外部裁判能捕获错误,但裁判本身在获得任务合同前也是错误的。猜测层面,该机制可能改变未来自改进智能体系统的评估范式,强调锚定参考集和共识机制的必要性,而非单纯依赖最终任务分数。

来源:arXiv cs.AI · arxiv.org