跳到正文
原文
arXiv cs.CR· Shuailong Wang, Xinyu Lyu, Shengming Yuan, Jingkuan Song, Heng Tao Shen, Lianli Gao·· 5 小时前精选AI 评分78

论文发现Token剪枝在多数情况下降低VLM安全性但提出SAP机制可修复漏洞

Understanding and Mitigating Token-Pruning-Induced Vulnerabilities in VLMs

AI 导读

该研究首次系统评估了视觉语言模型(VLM)中Token剪枝机制的安全性,发现大多数剪枝策略随剪枝比例增加会显著降低模型安全性,而基于查询的压缩策略在极端剪枝下反而提升安全性。作者识别出一种未被注意的机制称为"剪枝诱导的恶意放大",即移除背景Token会导致注意力坍缩到少数保留的前景恶意锚点上,从而在越狱攻击中无意中放大其毒性语义。

针对这一问题,研究者提出了推理时即插即用且无需额外训练的安全感知剪枝(SAP)机制,通过三个步骤对抗这种主导性:识别恶意锚点、恢复被剪枝的良性Token、将过度分配的注意力从恶意锚点重新分配给良性Token。在三个安全基准和四个效用基准上的广泛实验表明,SAP能将攻击成功率(ASR)降低高达62%,且不牺牲效率或效用。

事实层面,该论文已接受ICML 2026发表,涉及VLM架构中的Token剪枝与对齐问题;推断层面,当前主流加速方案若未考虑特定剪枝策略可能引入隐蔽安全风险,需重新评估端侧部署的鲁棒性;猜测层面,未来多模态模型优化可能需要将安全感知作为剪枝算法的内置约束而非事后补丁。

推荐理由

揭示剪枝策略对VLM安全的差异化影响及恶意放大机制,为端侧加速部署提供可验证的安全修正方案。

来源:arXiv cs.CR · arxiv.org