跳到正文
原文
arXiv cs.CR· Hui Zhang, Yachao Yuan, Jiayun Wang, Yuanzhuo Li, Hongtao Wang, Yali Yuan·· 6 小时前AI 评分70

SLDR 论文通过分层恢复与动态路由防御恶意微调并保留下游任务性能

SLDR: Defending Against Malicious Fine-tuning via Selective Layers Recovery and Dynamic Routing

AI 摘要

该论文针对微调即服务(Fine-tuning-as-a-service)场景下恶意微调侵蚀模型拒绝行为但保留合法任务表现的问题,提出了名为 SLDR 的后微调防御机制。研究重新审视了逐层安全诊断,发现安全敏感度具有符号特征:缩放不同层可能增强、减弱或几乎不影响拒绝能力。基于此观察,SLDR 仅在敏感度谱中最大和最小敏感度的层上训练 LoRA 恢复适配器,并利用基于表示的动态路由推理,仅在检测到恶意查询时激活该适配器。

实验在四种模型架构、五个下游任务和四个有害基准上进行,结果显示 SLDR 在大幅降低有害输出的同时保持了下游效用。具体数据表明,在 Llama3.1/SST2 设置下,平均有害分数从 11.54 降至 0.08,且在高达 0.9 的投毒比例下,有害分数仍维持在接近零的水平。代码已公开,该工作已被 NeurIPS 2026 接收。

事实层面,SLDR 利用敏感度符号差异定位关键层,仅对特定层应用修复,并通过动态路由控制激活时机。推断层面,这种机制可能显著降低防御成本,因为无需全量重训或修改基础模型权重,仅需轻量级适配器和推理时的路由逻辑。猜测层面,该方法在极端投毒比例下的鲁棒性是否依赖于特定的敏感度分布模式,以及在实际生产环境中动态路由带来的延迟开销,仍需进一步验证。

来源:arXiv cs.CR · arxiv.org