Google 提出 RRSI 方法防止自优化 AI 智能体记忆测试任务
Google researchers find a way to keep self-improving AI agents from memorizing their tests
Google 研究人员发现,当前许多 AI 智能体的进步源于对评估框架(harness)的自动化递归优化,而非模型本身的升级,但这种自我优化会导致智能体过度记忆有限的测试任务,造成训练集分数虚高而在新任务上表现崩塌。为解决这一泛化失效问题,团队提出了正则化递归自改进(RRSI)框架,在保持框架可编辑的前提下,通过限制单次修改预算、追踪历史尝试以及引入严格审查者来剔除针对特定基准的作弊技巧。
实验数据显示,在冻结底层模型 Claude Opus 4.8 的情况下,RRSI 在训练任务上获得最高 14.1 分的提升,同时在五个从未见过的基准测试中取得 4.7 分的增益,且运行时 Token 消耗比未正则化版本减少约 30%。相比之下,其他优化方法虽然训练分数更高,但在未见任务上的表现甚至低于原始基线。该机制具有模型无关性,基于 Gemini 3.5 Flash 优化的编码框架同样提升了较弱模型 Gemini 3.1 Flash Lite 的准确率。
事实层面,该研究仅针对固定权重的模型环境验证了框架优化的有效性,未涉及模型权重变更场景;推断层面,这表明智能体能力的可靠提升依赖于将反馈转化为持久的框架结构变化,而非短期的参数或策略微调;猜测层面,随着 Agent 生态向自主迭代演进,此类防止过拟合的正则化手段可能成为构建通用智能体的标准工程组件。代码已开源至 GitHub。
揭示自优化智能体因测试集过拟合导致泛化失效的机制,并提供通过正则化约束保持泛化能力的具体方案。
来源:The Decoder · the-decoder.com