跳到正文
原文
arXiv cs.CR· Md Nurul Absar Siddiky, Liuwan Zhu, Yingfei Dong·· 6 小时前AI 评分75

稀疏 MoE 大语言模型中梯度敏感度比激活频率更能识别安全敏感专家

Frequency Is Not Sensitivity Identifying Safety-Sensitive Experts in Sparse MoE LLM

AI 摘要

该研究指出在稀疏混合专家(MoE)架构中,抑制少量路由专家会削弱模型的安全行为,而传统方法依赖激活频率来筛选专家存在根本缺陷,因为频率仅衡量使用次数而非影响力。作者提出使用路由器梯度敏感度作为替代方案,即序列损失对选择专家的门控权重的敏感度,并在五种 MoE 架构上进行了验证。

实验在 500 个良性提示和 500 个恶意提示上对专家进行排序,并在 100 个保留的恶意提示上测量拒绝率。结果显示,在两种预算条件下(相等专家数量和相等名义恶意路由流量),基于路由器梯度的选择在 25 种条件中的 24 种下比激活频率导致更高的拒绝率下降,且优于随机选择的平均值。在 OLMoE 模型中效果最显著,拒绝率从 34 降至 9(相对下降 73.53%),且未出现输出质量退化,表明这是实质性的合规提升而非生成崩溃。即使在各层匹配专家数量后,梯度选择在 23 种条件下仍优于激活频率。

探索性跨模型分析显示,恶意与良性提示的浓度差距越大,峰值梯度效应越明显(rho = 0.90)。事实部分确认了梯度方法在测试条件下的优越性;推断认为该方法可优化 MoE 模型的安全对齐机制;猜测部分涉及该方法在不同非测试架构或极端分布下的泛化能力,原文未提供数据支持。

来源:arXiv cs.CR · arxiv.org