跳到正文
热点事件持续更新

ZoneClaw提出内存分区防御持久性记忆攻击

1 篇报道1 个报道来源9 小时前更新

先了解这件事

AI 综述

2026年10月2日,arXiv cs.CR 发布论文《ZoneClaw 通过记忆分区降低 OpenClaw 风格计算机使用 Agent 的持久记忆攻击成功率》。论文提出 ZoneClaw,用分层信任区替代 OpenClaw 风格 computer-use agent 的扁平工作区记忆,以缓解持久记忆注入攻击。其核心不是阻止外部内容被记住,而是把“可持久保存”和“可指导行动”拆开:外部声明先进入低信任区,只有跨越显式权限边界并经过攻击者不可直接写入区域交叉校验后,才能获得行动授权。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv cs.CR精选
    ZoneClaw 通过记忆分区降低 OpenClaw 风格计算机使用 Agent 的持久记忆攻击成功率

    这篇论文提出 ZoneClaw,用分层信任区替代 OpenClaw 风格 computer-use agent 的扁平工作区记忆,以缓解持久记忆注入攻击。其核心不是阻止外部内容被记住,而是把“可持久保存”和“可指导行动”拆开:外部声明先进入低信任区,只有跨越显式权限边界并经过攻击者不可直接写入区域交叉校验后,才能获得行动授权。 作者指出的攻击链是:攻击者控制看似无害的外部内容,诱导 Agent 在正常任务中记录有利于攻击者的声明,这些声明随后影响攻击者未接触过的后续任务。论文称既有防御多在内容进入记忆前或后续动作执行时干预,较少处理“已存储内容是否可指导行动”。在四个攻击场景、两种注入设置和四个 backbone 上,ZoneClaw 将 ASR 从 372/480 降至 6/480,同时在 458/480 次试验中保持效用,并对部分具备防御意识的攻击者仍有效。 事实是论文给出了分区、权限边界和实验数字;推断是这种设计意味着 Agent 记忆系统的安全重点会从内容过滤转向权限治理;猜测是若该方法在真实长期助手环境中复现,低信任记忆区可能成为 Agent 安全架构的常见组件。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。