视觉记忆注入攻击可持久化于KV缓存
先了解这件事
2026年10月8日,arXiv发布论文指出对抗性输入(如恶意图像)可通过键值(KV)缓存持久化操控大语言模型。研究提出Persistent Visual Memory Injection (P-VMI)方法,证明即使从上下文中移除且被注意力机制屏蔽,诱导的对抗行为仍能保留在缓存状态中。在Qwen3-VL-8B-Instruct模型上,最强配置下目标成功率约达90%,且该攻击在比训练时更长的对话轮次中依然有效。实验通过缓存交换消融验证了持久性机制。
AI 根据报道生成 · 3 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv cs.CR精选视觉记忆注入攻击可通过 KV 缓存持久化并绕过注意力掩码
该论文证明对抗性输入(如恶意图像)可在从上下文中移除后,仍通过键值(KV)缓存持续操控大语言模型行为。研究提出 Persistent Visual Memory Injection (P-VMI) 方法,优化后的图像即使被注意力机制屏蔽,其诱导的对抗行为仍能保留在缓存状态中。在 Qwen3-VL-8B-Instruct 模型上,最强配置下目标成功率约达 90%,且该攻击在比训练时更长的对话轮次中依然有效。 实验通过缓存交换消融验证了持久影响确实源自 KV 缓存而非其他路径。更关键的是,攻击能耐受模型生成的摘要压缩过程——只要摘要保留了原始图像的 KV 缓存,恶意行为即可延续。这意味着传统的“移除上下文即切断攻击”假设在多模态系统中失效,因为缓存状态本身可能成为攻击载体。 事实层面:攻击利用 KV 缓存实现持久化,在特定模型和配置下成功率高;推断层面:现有缓存清理或压缩机制若未彻底清除相关 KV 向量,将留下安全隐患;猜测层面:此类攻击可能难以被常规内容过滤系统检测,因其不依赖当前可见输入。产业链需重新审视端侧与云端推理引擎中的缓存管理逻辑,尤其是涉及多模态输入的长期会话场景。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。