SAP机制缓解VLM Token剪枝引发的安全风险
先了解这件事
2026年10月8日,一项研究首次系统评估了视觉语言模型(VLM)中Token剪枝的安全性。研究发现,大多数剪枝策略随比例增加会显著降低安全性,但基于查询的压缩策略在极端剪枝下反而提升安全性。研究者识别出“剪枝诱导的恶意放大”机制,即移除背景Token会导致注意力坍缩到前景恶意锚点,无意中放大越狱攻击的毒性语义。针对此问题,作者提出了推理时即插即用且无需额外训练的安全感知剪枝(SAP)机制以对抗该漏洞。
AI 根据报道生成 · 4 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv cs.CR精选论文发现Token剪枝在多数情况下降低VLM安全性但提出SAP机制可修复漏洞
该研究首次系统评估了视觉语言模型(VLM)中Token剪枝机制的安全性,发现大多数剪枝策略随剪枝比例增加会显著降低模型安全性,而基于查询的压缩策略在极端剪枝下反而提升安全性。作者识别出一种未被注意的机制称为"剪枝诱导的恶意放大",即移除背景Token会导致注意力坍缩到少数保留的前景恶意锚点上,从而在越狱攻击中无意中放大其毒性语义。 针对这一问题,研究者提出了推理时即插即用且无需额外训练的安全感知剪枝(SAP)机制,通过三个步骤对抗这种主导性:识别恶意锚点、恢复被剪枝的良性Token、将过度分配的注意力从恶意锚点重新分配给良性Token。在三个安全基准和四个效用基准上的广泛实验表明,SAP能将攻击成功率(ASR)降低高达62%,且不牺牲效率或效用。 事实层面,该论文已接受ICML 2026发表,涉及VLM架构中的Token剪枝与对齐问题;推断层面,当前主流加速方案若未考虑特定剪枝策略可能引入隐蔽安全风险,需重新评估端侧部署的鲁棒性;猜测层面,未来多模态模型优化可能需要将安全感知作为剪枝算法的内置约束而非事后补丁。
本事件热度走势
当前热度 9·可比范围峰值 9(10月8日 14:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。