跳到正文
原文
arXiv cs.CR· Itay Zloczower, Eyal Lenga, Gilad Gressel, Yisroel Mirsky·· 3 小时前精选AI 评分78

论文证实针对恶意微调的防御在持续训练下会失效

A Few Steps Further: Why Defenses Against Malicious Finetuning Erode Under Continued Training

AI 导读

该研究通过实验发现,当前针对恶意微调(malicious finetuning)的十五种主流防御机制在面对攻击者延长训练时长的情况下普遍失效。尽管这些防御旨在使对齐(alignment)在发布后保持鲁棒性,但测试显示所有72次被防御的运行中,模型在训练结束时的有害程度均高于发布时,部分条件下甚至接近无防御状态。

核心证据来自对四个开源权重模型(如Llama-3.1)的实测:攻击者仅使用有害数据进行连续三个epoch的微调。结果显示,现有防御大多基于受限的攻击者模型构建,例如假设扰动有界、模拟攻击时间短或依赖有害与良性行为间的固定关联,一旦释放权重并允许无限训练,这些保护即刻瓦解。虽然个别防御在特定模型上能暂时压低有害性,或迫使攻击以牺牲通用能力为代价恢复有害性,但这并非持久保护。

事实层面,研究确认了“持续训练”是比固定预算攻击更简单的升级路径;推断层面,这意味着目前开源模型发布后的安全护栏不具备抗长期对抗训练的耐久性;猜测层面,若行业继续依赖此类短期防御而忽视权重释放后的动态风险,可能导致大规模模型滥用。结论明确:现有措施只能延缓或干扰恶意微调,不应被视为长期解决方案。

推荐理由

实证证明持续训练可瓦解现有防御,直接修正对开源模型长期安全性的评估。

来源:arXiv cs.CR · arxiv.org