跳到正文
原文
arXiv cs.AI· Juli Huang·· 15 小时前AI 评分65

论文指出在受限内存评估中必须分离保留与检索以识别真实性能瓶颈

What Should an Agent Remember? Disentangling Retention from Retrieval in Bounded-Memory Evaluation

AI 摘要

该研究针对持久化智能体(persistent agent)的内存机制提出新的评估框架,核心发现是现有的基准测试往往混淆了信息保留(retention)与信息检索(retrieval)两个决策过程,导致对模型能力的误判。作者构建了一个流式召回基准,在相同的300个种子片段上交叉测试不同的保留和选择规则,并严格控制历史访问权限。

关键数据表明,当保持访问权限固定时,基于查询感知的选择策略将所需事实的召回率提升了15.5个百分点(95%置信区间:12.8至18.2)。然而,若进行混合比较并同时改变历史访问权限,则报告了高达68.7点的优势,其中53.2个点实际上归因于访问权限的差异而非选择算法本身。此外,在受限保留条件下,所有319次观测到的失败均源于驱逐(eviction)而非排序错误;随着目标信息在时间轴上推移,召回率会降至0%。

这些结果明确区分了事实与推断:事实是访问权限的变化掩盖了选择策略的真实增益,且召回率在目标过远时会归零;推断是当前的行业评测标准可能高估了检索模块的贡献;猜测是未来设计Agent记忆系统时,应优先优化驱逐策略而非单纯提升检索算法。文章建议未来的受限内存评估应固定访问权限,并将保留率和选择率分开报告。

来源:arXiv cs.AI · arxiv.org