跳到正文
原文
arXiv cs.AI· Chang Liu, Deliang Ding·· 4 小时前AI 评分70

LLM Agent持久化记忆治理研究:准入与呈现的权衡

What to Admit and How to Present: Governing Persistent Memory in LLM Agents

AI 摘要

该论文提出在无需重训练的情况下,通过推理时的两种设计来治理LLM Agent的持久化记忆,以解决个性化带来的顺从性(sycophancy)和跨域泄露问题。研究区分了“准入”(决定哪些记忆进入工作上下文)和“呈现”(决定如何表达已准入信息)两个治理决策,并实现了因子编译准入(FC)和权限语义准入(PS)两种方案。

实验数据显示,相对于直接注入,FC和PS方案在外部基准测试中将综合失败率分别降低了6.7和8.8个百分点,开发集中的跨域泄露最高减少了29.5个百分点。然而,收紧准入策略虽然进一步将跨域失败率降低了17.5个百分点,但也导致个性化失败增加,且PS方案未能达到预注册的个性化保持标准。相比之下,固定呈现方式时,不同的输出渲染方式在多重比较校正后无显著差异。

事实层面,该研究证实了优化记忆准入选择质量能带来任务特定的安全增益,但保留有益记忆使用的效果尚未解决。推断层面,这意味着当前Agent架构中单纯依赖记忆增强可能无法同时满足安全与个性化的双重目标,需在系统设计时明确取舍。猜测层面,未来可能需要引入更复杂的动态预算或分层记忆策略来平衡这两者,但这超出了本文验证的范围。

来源:arXiv cs.AI · arxiv.org