跳到正文
热点事件持续更新

Qwen3-VL与Kimi-VL路由logits可预测多模态安全风险

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026年10月7日,一项研究提出基于路由logits的多模态安全检测方法。该论文针对混合专家(MoE)视觉语言模型中图文交互产生的组合安全风险,发现路由器logits本身包含高度可预测的安全信号。据此构建的轻量级检测器无需修改模型参数,即可在生成前识别不安全请求。该方法在Qwen3-VL和Kimi-VL上验证,显著降低了HoliSafe基准上的安全错误率,并在MISHard和MM-SafetyBench等分布外基准上表现出良好性能。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.CL
    Qwen3-VL 与 Kimi-VL 的路由 logits 可预测多模态安全风险且无需修改模型参数

    该论文针对混合专家(MoE)视觉语言模型(VLM)中因图文交互产生的组合安全风险,提出一种不干预模型内部状态的安全检测方法。作者发现路由器 logits 本身包含高度可预测的安全信号,并据此构建了一个轻量级路由器日志安全检测器。该方法在 Qwen3-VL 和 Kimi-VL 上验证,能在生成前识别不安全请求,显著降低 HoliSafe 基准上的安全错误率,并在 MISHard 和 MM-SafetyBench 等分布外基准上表现出良好的泛化能力。 与传统通过提示工程、监督微调或专家路由引导来干预模型行为的方法不同,本文方法的核心在于“读取”而非“操纵”。现有干预手段往往导致过度拒绝(over-refusal),引发安全与效用之间的权衡问题。而本研究的检测器仅在 prompt prefill 阶段读取路由信号,不修改模型参数或专家路由逻辑。实验数据显示,这种非侵入式机制在保持模型原有能力的同时,有效拦截了有害意图,证明了利用自然涌现的内部信号作为外部安全机制补充的可行性。 事实层面,该研究基于 arXiv:2610.07774,测试对象明确为 Qwen3-VL 和 Kimi-VL,评估基准包括 HoliSafe、MISHard 和 MM-SafetyBench。推断层面,这表明未来 MoE 架构的安全防护可能从复杂的内部干预转向更轻量的外部信号监测,减少计算开销和对模型性能的潜在损害。猜测层面,若该方法能推广至更多闭源或开源 VLM 架构,可能会成为行业标准的安全前置层,但具体部署成本及对抗样本下的鲁棒性仍需进一步实证。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。