跳到正文
原文
arXiv cs.CR· Jungseob Lee, Dongyub Jude Lee, Sugyeong Eo, Seongtae Hong, Seungyoon Lee, Heuiseok Lim·· 8 小时前精选AI 评分78

论文显示少样本有害微调后,定位安全层并冻结仍可能被攻击者绕过

Refusal Localizes, the Damage Relocates: Safety Layers Under Few-Sample Fine-Tuning

AI 导读

这篇 arXiv 论文测试了对齐大语言模型在少样本有害微调下的安全防御是否能抵抗攻击变化。作者发现,即使在攻击后,有害与无害提示在隐藏状态上仍线性可分,把干净模型的完整隐藏状态补回到受攻击模型,也能在一个可复现的过渡深度恢复拒绝行为。

推荐理由

它提醒做微调安全的人:把拒绝行为定位到某层并不等于可防御,冻结或谱修复都可能被自适应攻击绕过。

来源:arXiv cs.CR · arxiv.org