跳到正文
原文
arXiv cs.CR· David Dobre, Leo Schwinn, Gauthier Gidel, Spandana Gella, Perouz Taslakian, Pierre-Andr\'e No\"el·· 5 小时前精选AI 评分82

视觉记忆注入攻击可通过 KV 缓存持久化并绕过注意力掩码

Visual Memory Attacks Can Persist Through The KV Cache

AI 导读

该论文证明对抗性输入(如恶意图像)可在从上下文中移除后,仍通过键值(KV)缓存持续操控大语言模型行为。研究提出 Persistent Visual Memory Injection (P-VMI) 方法,优化后的图像即使被注意力机制屏蔽,其诱导的对抗行为仍能保留在缓存状态中。在 Qwen3-VL-8B-Instruct 模型上,最强配置下目标成功率约达 90%,且该攻击在比训练时更长的对话轮次中依然有效。

实验通过缓存交换消融验证了持久影响确实源自 KV 缓存而非其他路径。更关键的是,攻击能耐受模型生成的摘要压缩过程——只要摘要保留了原始图像的 KV 缓存,恶意行为即可延续。这意味着传统的“移除上下文即切断攻击”假设在多模态系统中失效,因为缓存状态本身可能成为攻击载体。

事实层面:攻击利用 KV 缓存实现持久化,在特定模型和配置下成功率高;推断层面:现有缓存清理或压缩机制若未彻底清除相关 KV 向量,将留下安全隐患;猜测层面:此类攻击可能难以被常规内容过滤系统检测,因其不依赖当前可见输入。产业链需重新审视端侧与云端推理引擎中的缓存管理逻辑,尤其是涉及多模态输入的长期会话场景。

推荐理由

揭示攻击可借 KV Cache 在图像移除后持续生效,需重新评估长上下文系统的缓存清理与压缩策略。

来源:arXiv cs.CR · arxiv.org