MoE模型安全专家识别新方案:梯度敏感度优于激活频率
先了解这件事
2026年10月5日,一项发表于arXiv cs.CR的研究指出,在稀疏混合专家(MoE)架构中,抑制少量路由专家会削弱模型的安全行为。研究认为传统依赖激活频率筛选专家的方法存在根本缺陷,因其仅衡量使用次数而非影响力。作者提出以路由器梯度敏感度(序列损失对门控权重的敏感度)作为替代方案,并在五种MoE架构上进行了验证。实验在500个良性提示和500个恶意提示上对专家排序,并在100个保留的恶意提示上测量拒绝率,结果显示该方法在不同预算条件下表现有效。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv cs.CR稀疏 MoE 大语言模型中梯度敏感度比激活频率更能识别安全敏感专家
该研究指出在稀疏混合专家(MoE)架构中,抑制少量路由专家会削弱模型的安全行为,而传统方法依赖激活频率来筛选专家存在根本缺陷,因为频率仅衡量使用次数而非影响力。作者提出使用路由器梯度敏感度作为替代方案,即序列损失对选择专家的门控权重的敏感度,并在五种 MoE 架构上进行了验证。 实验在 500 个良性提示和 500 个恶意提示上对专家进行排序,并在 100 个保留的恶意提示上测量拒绝率。结果显示,在两种预算条件下(相等专家数量和相等名义恶意路由流量),基于路由器梯度的选择在 25 种条件中的 24 种下比激活频率导致更高的拒绝率下降,且优于随机选择的平均值。在 OLMoE 模型中效果最显著,拒绝率从 34 降至 9(相对下降 73.53%),且未出现输出质量退化,表明这是实质性的合规提升而非生成崩溃。即使在各层匹配专家数量后,梯度选择在 23 种条件下仍优于激活频率。 探索性跨模型分析显示,恶意与良性提示的浓度差距越大,峰值梯度效应越明显(rho = 0.90)。事实部分确认了梯度方法在测试条件下的优越性;推断认为该方法可优化 MoE 模型的安全对齐机制;猜测部分涉及该方法在不同非测试架构或极端分布下的泛化能力,原文未提供数据支持。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。