SLDR:通过选择性层恢复和动态路由防御恶意微调
先了解这件事
2026年10月8日,arXiv发布论文提出SLDR机制,旨在解决微调即服务场景下恶意微调侵蚀模型拒绝行为的问题。该研究重新审视逐层安全诊断,发现安全敏感度具有符号特征。基于此,SLDR仅在敏感度谱中最大和最小敏感度的层上训练LoRA恢复适配器,并利用基于表示的动态路由推理,仅在检测到恶意查询时激活该适配器。实验在四种模型架构上进行验证,结果显示该方法能有效防御恶意微调并保留下游任务性能。
AI 根据报道生成 · 3 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv cs.CRSLDR 论文通过分层恢复与动态路由防御恶意微调并保留下游任务性能
该论文针对微调即服务(Fine-tuning-as-a-service)场景下恶意微调侵蚀模型拒绝行为但保留合法任务表现的问题,提出了名为 SLDR 的后微调防御机制。研究重新审视了逐层安全诊断,发现安全敏感度具有符号特征:缩放不同层可能增强、减弱或几乎不影响拒绝能力。基于此观察,SLDR 仅在敏感度谱中最大和最小敏感度的层上训练 LoRA 恢复适配器,并利用基于表示的动态路由推理,仅在检测到恶意查询时激活该适配器。 实验在四种模型架构、五个下游任务和四个有害基准上进行,结果显示 SLDR 在大幅降低有害输出的同时保持了下游效用。具体数据表明,在 Llama3.1/SST2 设置下,平均有害分数从 11.54 降至 0.08,且在高达 0.9 的投毒比例下,有害分数仍维持在接近零的水平。代码已公开,该工作已被 NeurIPS 2026 接收。 事实层面,SLDR 利用敏感度符号差异定位关键层,仅对特定层应用修复,并通过动态路由控制激活时机。推断层面,这种机制可能显著降低防御成本,因为无需全量重训或修改基础模型权重,仅需轻量级适配器和推理时的路由逻辑。猜测层面,该方法在极端投毒比例下的鲁棒性是否依赖于特定的敏感度分布模式,以及在实际生产环境中动态路由带来的延迟开销,仍需进一步验证。
本事件热度走势
当前热度 9·可比范围峰值 9(10月8日 14:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。