跳到正文
原文
arXiv cs.CL· Ziyuan Yang, Wenxuan Ding, Shangbin Feng, Yulia Tsvetkov·· 5 小时前AI 评分72

Qwen3-VL 与 Kimi-VL 的路由 logits 可预测多模态安全风险且无需修改模型参数

Reading, Not Manipulating: Leveraging Router Logits for Multimodal Safety in MoE Vision-Language Models

AI 摘要

该论文针对混合专家(MoE)视觉语言模型(VLM)中因图文交互产生的组合安全风险,提出一种不干预模型内部状态的安全检测方法。作者发现路由器 logits 本身包含高度可预测的安全信号,并据此构建了一个轻量级路由器日志安全检测器。该方法在 Qwen3-VL 和 Kimi-VL 上验证,能在生成前识别不安全请求,显著降低 HoliSafe 基准上的安全错误率,并在 MISHard 和 MM-SafetyBench 等分布外基准上表现出良好的泛化能力。

与传统通过提示工程、监督微调或专家路由引导来干预模型行为的方法不同,本文方法的核心在于“读取”而非“操纵”。现有干预手段往往导致过度拒绝(over-refusal),引发安全与效用之间的权衡问题。而本研究的检测器仅在 prompt prefill 阶段读取路由信号,不修改模型参数或专家路由逻辑。实验数据显示,这种非侵入式机制在保持模型原有能力的同时,有效拦截了有害意图,证明了利用自然涌现的内部信号作为外部安全机制补充的可行性。

事实层面,该研究基于 arXiv:2610.07774,测试对象明确为 Qwen3-VL 和 Kimi-VL,评估基准包括 HoliSafe、MISHard 和 MM-SafetyBench。推断层面,这表明未来 MoE 架构的安全防护可能从复杂的内部干预转向更轻量的外部信号监测,减少计算开销和对模型性能的潜在损害。猜测层面,若该方法能推广至更多闭源或开源 VLM 架构,可能会成为行业标准的安全前置层,但具体部署成本及对抗样本下的鲁棒性仍需进一步实证。

来源:arXiv cs.CL · arxiv.org