arXiv cs.CR· Giulio Zingrillo, Hanna Foerster, Ilia Shumailov, Yiren Zhao, Robert Mullins·· 4 小时前精选AI 评分80
论文提出COBRA架构解决Computer Use Agents的分支劫持攻击问题
Securing Computer-Use Agents Against Branch Steering Attacks
AI 导读
该论文指出现代Computer Use Agents (CUAs) 因需根据动态网页内容执行分支计划,导致原本提供形式化安全保证的Dual-LLM架构失效,面临分支劫持(branch steering)攻击风险。作者构建了包含9个领域101项任务的STEER-Bench基准测试,结果显示标准CUA和基础Dual-LLM CUAs的攻击成功率分别高达94.4%和89.5%,证明现有主流架构无法抵御此类间接提示注入。
针对上述漏洞,研究者提出了COBRA架构,其核心机制是将可信的分支计划与事前能力约束相结合,严格限定每个分支可执行的参数和目的地。在STEER-Bench测试中,COBRA将攻击成功率降至0%,同时保留了97%的正常任务效用。这一结果直接验证了通过限制分支执行范围而非仅依赖隔离LLM来防御动态环境攻击的有效性。
事实层面,该研究确认了CUA在图形交互中的特定脆弱性,并给出了具体的防御架构名称及测试数据。推断层面,这意味着未来构建高安全性Agent时,单纯采用双LLM隔离模式可能不足以应对复杂UI场景,必须引入对分支逻辑的事前约束机制。猜测层面,COBRA的具体实现细节及其在真实商业产品中的集成成本尚未披露,但其理论框架为Agent安全设计提供了新的方向。
推荐理由
揭示Dual-LLM架构在图形界面场景下的分支劫持漏洞,并提供经实测零成功率的新防御方案。
来源:arXiv cs.CR · arxiv.org