跳到正文
原文
arXiv cs.AI· Chinmay Savadikar, Zhaoyu Zhang, Mingyu Zhao, Shuang Xie, Han Li, Tianfu Wu, Lingyun Wang·· 5 小时前AI 评分65

AMBER 通过追加式记忆库提升长程 Web Agent 成功率并降低上下文成本

AMBER: Training Long-Horizon Web Agents through Append-Only Memory

AI 摘要

arXiv 论文提出 AMBER(Append-only Memory Bank for Evidence Retention)框架,解决现代语言模型智能体在长周期多步轨迹中因交互历史超出上下文预算而丢失关键事实的问题。该框架让智能体联合学习推理、行动和自由形式记忆写入,并通过追加规则从构造上保证信息保留,无需维护完整执行历史或依赖昂贵的监督微调数据。

在 WebArena Lite 基准测试中,AMBER 相比基于覆盖式记忆的基线将平均成功率提高了 4.09 个百分点,五次重复运行中完成任务的比例提升了 4.8 个百分点,且性能匹配了使用大量昂贵人工标注数据进行训练的覆盖式基线。研究发现,覆盖式记忆必须学习在每次重写时携带每个事实,这在稀疏结果奖励下难以训练,导致交互式应用中关键信息和环境反馈被删除;而 AMBER 通过追加机制避免了这一缺陷,同时保持了实用的 token 预算。

事实层面,AMBER 实现了端到端的强化学习训练,无需广泛的人工 SFT 数据。推断层面,追加式记忆可能成为长程 Agent 系统的标准组件,因为它解决了覆盖式存储在稀疏奖励下的不可靠性。猜测层面,该架构若迁移至其他需要长期状态跟踪的领域(如复杂代码生成或自动化运维),可能进一步降低对超大上下文窗口的依赖,但具体效果需验证。

来源:arXiv cs.AI · arxiv.org