跳到正文
原文
arXiv cs.CR· Wanjing Han, Levi Taiji Li, Mu Zhang, Yue Jiang, Guanhong Tao·· 5 小时前精选AI 评分82

WebMirage框架证明视觉对抗攻击能劫持从视觉定位到浏览器执行的完整链路

Adversarial Images Hijack Web Agents from Visual Grounding to Browser Execution

AI 导读

该论文提出WebMirage框架,通过构造局部视觉扰动成功劫持基于大视觉语言模型的现代Web Agent,使其选择攻击者控制的UI元素并执行对应浏览器操作。在涵盖13个公共网站和沙盒基准的2,250项任务中,该框架在四种Agent配置和六种VLM骨干网络上实现了91.9%的平均攻击成功率,而最强基线仅为17.4%,且该方法能有效绕过三种现有的Agent级防御措施。

研究指出,现有视觉红队测试主要关注模型推理阶段,忽略了结构化输入处理和动作后处理环节,导致模型层面的成功无法确立对浏览器执行的控制权。WebMirage通过角色槽位抽象和网页重组捕捉页面元素间的竞争关系,并利用数据流分析将优化过程与动作后处理对齐,从而解决了端到端接地到执行的鸿沟问题。

事实层面,该研究量化了视觉对抗攻击在端到端Agent中的有效性;推断层面,这表明当前依赖视觉定位的Agent系统存在严重的执行层漏洞,单纯提升模型推理能力不足以保障安全;猜测层面,若此类攻击被广泛利用,可能导致自动化浏览任务面临大规模恶意操控风险,需重新审视Agent系统的防御架构。

推荐理由

材料揭示视觉对抗攻击可穿透端到端执行层,直接校正对Web Agent鲁棒性的评估结论。

来源:arXiv cs.CR · arxiv.org