热点事件持续更新
NEEDLE方法通过权重正交化移除LLM后门
1 篇报道1 个报道来源12 小时前更新
先了解这件事
AI 综述
2026年10月2日,arXiv cs.CR发布研究提出NEEDLE方法,用于移除大语言模型中的后门。该方法为训练无关方案,通过估计激活向量识别后门方向与拒绝子空间,并对序列权重进行正交化以抑制后门。研究称其无需干净参考模型或原始中毒数据。在多种模型家族和攻击类型评估中,NEEDLE实现最低平均攻击成功率,其中代码注入攻击ASR为0%。同时,该方法保持最低KL散度,并带来最小的能力与安全变化。
AI 根据报道生成 · 2 小时前更新
最新进展10月2日 12:00
研究提出NEEDLE,通过权重正交化移除LLM后门。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- arXiv cs.CR提出 NEEDLE 方法:通过权重正交化移除大语言模型后门
研究提出训练无关的 NEEDLE 方法,利用激活向量估计后门方向与拒绝子空间,通过序列权重正交化抑制后门。该方法无需干净参考模型或原始中毒数据,在多种模型家族和攻击类型评估中实现最低平均攻击成功率(ASR),代码注入攻击 ASR 达 0%。NEEDLE 同时保持最低的 KL 散度及最小的能力与安全变化。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。