跳到正文
热点事件持续更新

NEEDLE方法通过权重正交化移除LLM后门

1 篇报道1 个报道来源12 小时前更新

先了解这件事

AI 综述

2026年10月2日,arXiv cs.CR发布研究提出NEEDLE方法,用于移除大语言模型中的后门。该方法为训练无关方案,通过估计激活向量识别后门方向与拒绝子空间,并对序列权重进行正交化以抑制后门。研究称其无需干净参考模型或原始中毒数据。在多种模型家族和攻击类型评估中,NEEDLE实现最低平均攻击成功率,其中代码注入攻击ASR为0%。同时,该方法保持最低KL散度,并带来最小的能力与安全变化。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv cs.CR
    提出 NEEDLE 方法:通过权重正交化移除大语言模型后门

    研究提出训练无关的 NEEDLE 方法,利用激活向量估计后门方向与拒绝子空间,通过序列权重正交化抑制后门。该方法无需干净参考模型或原始中毒数据,在多种模型家族和攻击类型评估中实现最低平均攻击成功率(ASR),代码注入攻击 ASR 达 0%。NEEDLE 同时保持最低的 KL 散度及最小的能力与安全变化。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。