arXiv cs.AI· Olukunle Owolabi, Pulkit Gupta, Fei Wang·· 5 小时前AI 评分52
NeurIPS 2026 论文提出按语义类别动态调整 Agent 记忆保留阈值以提升可靠性
When to Remember, When to Abstain: Category-Conditioned Retention for Reliable Agent Memory
AI 摘要
该研究针对持久化 Agent 记忆中的不可靠问题,提出一种基于断言语义类别的条件保留机制,而非使用全局单一的置信度阈值。在部署的冷启动记忆管道中,对 100 个合成 persona 进行的实证评估显示,不同类别的证据支持率存在显著差异:4,715 个候选断言中,价值和信念类断言仅 77.9% 有来源支持,而其他类别高达 96.2%。这种可靠性不对称使得全局阈值难以兼顾,要么引入未经验证的价值观主张,要么丢弃证据充分的通用信息。
实验结果表明,仅对价值类断言实施更严格的保留门槛,可将不支持的保留率从 6.2% 降低至 4.0%,实现约 36% 的相对减少。同时,在同等保留水平下,该方法比全局阈值多保留了约 13 个百分点的覆盖范围(95% CI 9.8--16.0)。这一发现证实了可靠记忆保留取决于断言类型而非单纯的置信度数值,类别条件阈值可作为写入边界的一种简单有效的选择性预测形式。
事实层面,该工作已发表于 NeurIPS 2026 Social Agent Workshop,核心结论基于 4,715 条数据的统计对比。推断层面,这意味着当前通用的 Agent 记忆模块若采用统一阈值,可能在处理涉及用户价值观或信念的内容时产生系统性幻觉风险。猜测层面,未来工程实践中可能需要将“类别识别”作为记忆写入前的前置步骤,但这会增加推理开销,具体成本需结合实际部署环境验证。
来源:arXiv cs.AI · arxiv.org