跳到正文
原文
arXiv cs.AI· Zekai Wang, Yingqiang Ge, Zekun Wang, Hai Wang, Yuhui Xu, Joshua Frandsen, Shancong Fu, Ashia C. Wilson, Chandan K. Reddy·· 4 小时前AI 评分70

VERSE 论文证实执行验证是 Agent 自进化优化的必要前提并报告 SWE-rebench 基准表现

VERSE: Verified Self-Evolving Optimizer for Agent Harnesses

AI 摘要

该研究通过受控实验发现,缺乏执行验证的优化器自进化无法提升 Agent 性能,而引入验证机制后能达到最佳结果。作者据此提出 VERSE(Verified Self-Evolving Optimizer for Agent Harnesses),一种允许优化器在提交前测试草稿编辑、重放失败案例并扰动可疑步骤的框架。该框架在保持优化器和执行器模型权重固定的前提下,追踪修复与回归情况,并同步修订执行器的提示词、技能、工具及工作流。

在共享协议且训练、验证和测试任务分离的条件下,VERSE 在五个语言的新颖分布外任务上提升了四种评估过的优化器表现。其最佳验证选中的执行器在 SWE-rebench 任务上达到 42.3% 准确率,在新任务上达到 37.7%,显著优于最强基线模型的 39.2% 和 29.3%。代码已开源。

事实层面,本研究确立了执行验证对自进化优化的必要性,并提供了具体的性能数据对比;推断层面,这表明未来 Agent 开发中,优化流程必须内嵌自动化测试与重放机制而非仅依赖静态提示词调整;猜测层面,若该协议能泛化至更复杂的长程规划任务,可能改变当前 Agent 调试主要依赖人工经验的现状。

来源:arXiv cs.AI · arxiv.org