arXiv cs.CR· Haokai Ma, Chieh Lin, Yupeng Qiu, Ee-Chien Chang·· 9 小时前精选AI 评分78
ZoneClaw 通过记忆分区降低 OpenClaw 风格计算机使用 Agent 的持久记忆攻击成功率
ZoneClaw: Mitigating Persistent Memory Attacks by Establishing Memory-Zoning in OpenClaw-Style Computer-Use Agents
AI 导读
这篇论文提出 ZoneClaw,用分层信任区替代 OpenClaw 风格 computer-use agent 的扁平工作区记忆,以缓解持久记忆注入攻击。其核心不是阻止外部内容被记住,而是把“可持久保存”和“可指导行动”拆开:外部声明先进入低信任区,只有跨越显式权限边界并经过攻击者不可直接写入区域交叉校验后,才能获得行动授权。
作者指出的攻击链是:攻击者控制看似无害的外部内容,诱导 Agent 在正常任务中记录有利于攻击者的声明,这些声明随后影响攻击者未接触过的后续任务。论文称既有防御多在内容进入记忆前或后续动作执行时干预,较少处理“已存储内容是否可指导行动”。在四个攻击场景、两种注入设置和四个 backbone 上,ZoneClaw 将 ASR 从 372/480 降至 6/480,同时在 458/480 次试验中保持效用,并对部分具备防御意识的攻击者仍有效。
事实是论文给出了分区、权限边界和实验数字;推断是这种设计意味着 Agent 记忆系统的安全重点会从内容过滤转向权限治理;猜测是若该方法在真实长期助手环境中复现,低信任记忆区可能成为 Agent 安全架构的常见组件。
推荐理由
它把 Agent 持久记忆攻击从输入过滤转向权限分层,可改变长期记忆系统的安全设计优先级。
来源:arXiv cs.CR · arxiv.org