热点事件持续更新
少样本微调可绕过安全层防御
1 篇报道1 个报道来源8 小时前更新
先了解这件事
AI 综述
2026年10月2日,一篇arXiv论文研究了经过安全对齐的大语言模型在少样本有害微调下的防御鲁棒性。作者发现,即使模型经过此类攻击,有害与无害提示在隐藏状态上仍然线性可分;将干净模型的完整隐藏状态补回到受攻击模型后,可在一个可复现的过渡深度恢复拒绝行为。该结果还表明,定位安全层并冻结仍可能被攻击者绕过。
AI 根据报道生成 · 2 小时前更新
最新进展10月2日 12:00
论文称少样本有害微调后,定位并冻结安全层仍可能被绕过。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- arXiv cs.CR精选论文显示少样本有害微调后,定位安全层并冻结仍可能被攻击者绕过
这篇 arXiv 论文测试了对齐大语言模型在少样本有害微调下的安全防御是否能抵抗攻击变化。作者发现,即使在攻击后,有害与无害提示在隐藏状态上仍线性可分,把干净模型的完整隐藏状态补回到受攻击模型,也能在一个可复现的过渡深度恢复拒绝行为。 但防御并不稳健。基于既有层冻结方法,他们冻结到该过渡深度后,用 100 条有害样本重复攻击,六个检查点的拒绝率仍接近零,恢复转移会移到冻结边界之上。另一项实验中,移除更新的前两个奇异方向可在短注意力微调后恢复拒绝,但在 Llama-3.1-8B 上,普通训练变化会削弱该修复,攻击者若分散更新即可击败它;基于良性微调校准的谱检测器也漏掉多数修复失败。 事实是定位和恢复能揭示安全行为的位置,推断是攻击者可以绕过被识别的区域并击败跨多个检查点有效的修复。作者认为局部冻结在少量有害样本无意混入训练数据时仍可能保留拒绝能力,并提出针对自适应微调防御的五项检查。
本事件热度走势
当前热度 8·可比范围峰值 8(10月2日 18:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。