跳到正文
原文
arXiv cs.AI· Caiqi Zhang, Rujun Han, Zifeng Wang, Zoey CuiZhu, Nigel Collier, Tomas Pfister, Chen-Yu Lee·· 10 小时前AI 评分72

VeriHarness 用智能体验证机制提升长程任务的输出选择与修订效果

VeriHarness: Scaling Agentic Verification for Long-Horizon Tasks

AI 摘要

VeriHarness 在固定基础模型、测试时没有参考答案或评分标准的条件下,把生成器使用的 LLM 转成带工作区、证据工具和可复用验证技能的智能体验证器,用于长程任务输出的选择与修订。论文在五个长程工作区基准和两个前沿模型上测试,称其选择得分高于已评估基线;加入证据支持的修订后,相比单次 rollout,Gemini 3.5 Flash 平均提升 6.2 分,Claude Opus 4.8 平均提升 6.4 分。

方法上的关键判断是:多次采样产生的分歧常能暴露正确替代项,而共识可能掩盖错误。因此系统不是简单投票,而是设置两个角色:disagreement resolver 用环境证据检查竞争声明,consensus challenger 测试共同声明并寻找遗漏要求;验证结果再指导最终产物的选择和修订。论文还称验证技能可以从失败反馈中自我改进,并公开约 26,000 条跨五个基准、两个模型的 rollout,称生成成本超过 $100,000。

事实是论文报告了选择得分、修订增益、模型名称、基准数量和公开数据规模。推断是这套设计把验证从静态评分转向可调用证据的工作流,可能更适合长程任务的错误定位。猜测是其收益是否能在更多模型、任务和真实生产环境中保持,仍需看外部复现。

来源:arXiv cs.AI · arxiv.org