arXiv cs.CR· Minoo Kim, Vasileios Lampos, George Drayson·· 11 小时前AI 评分42
提出 NEEDLE 方法:通过权重正交化移除大语言模型后门
Removing the NEEDLE in the Haystack: Backdoor Removal in LLMs via Weight Orthogonalisation
AI 摘要
研究提出训练无关的 NEEDLE 方法,利用激活向量估计后门方向与拒绝子空间,通过序列权重正交化抑制后门。该方法无需干净参考模型或原始中毒数据,在多种模型家族和攻击类型评估中实现最低平均攻击成功率(ASR),代码注入攻击 ASR 达 0%。NEEDLE 同时保持最低的 KL 散度及最小的能力与安全变化。
来源:arXiv cs.CR · arxiv.org