研究证实持续训练下恶意微调防御普遍失效
先了解这件事
2026年10月8日,arXiv cs.CR发布论文指出,针对恶意微调的十五种主流防御机制在持续训练场景下普遍失效。实验对Llama-3.1等四个开源模型进行测试,攻击者仅使用有害数据连续微调三个epoch。结果显示,所有72次被防御的运行中,模型在训练结束时的有害程度均高于发布时,部分条件下甚至接近无防御状态。该研究证实,尽管现有防御旨在使对齐在发布后保持鲁棒性,但面对延长训练时长时无法有效阻止有害内容注入。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv cs.CR精选论文证实针对恶意微调的防御在持续训练下会失效
该研究通过实验发现,当前针对恶意微调(malicious finetuning)的十五种主流防御机制在面对攻击者延长训练时长的情况下普遍失效。尽管这些防御旨在使对齐(alignment)在发布后保持鲁棒性,但测试显示所有72次被防御的运行中,模型在训练结束时的有害程度均高于发布时,部分条件下甚至接近无防御状态。 核心证据来自对四个开源权重模型(如Llama-3.1)的实测:攻击者仅使用有害数据进行连续三个epoch的微调。结果显示,现有防御大多基于受限的攻击者模型构建,例如假设扰动有界、模拟攻击时间短或依赖有害与良性行为间的固定关联,一旦释放权重并允许无限训练,这些保护即刻瓦解。虽然个别防御在特定模型上能暂时压低有害性,或迫使攻击以牺牲通用能力为代价恢复有害性,但这并非持久保护。 事实层面,研究确认了“持续训练”是比固定预算攻击更简单的升级路径;推断层面,这意味着目前开源模型发布后的安全护栏不具备抗长期对抗训练的耐久性;猜测层面,若行业继续依赖此类短期防御而忽视权重释放后的动态风险,可能导致大规模模型滥用。结论明确:现有措施只能延缓或干扰恶意微调,不应被视为长期解决方案。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。