热点事件持续更新
零空间投影净化LoRA微调LLM后门
1 篇报道1 个报道来源11 小时前更新
先了解这件事
AI 综述
2026年10月2日,arXiv cs.AI 发布研究,提出一种针对 LoRA 微调大语言模型后门净化的方法。该方法不需要触发器先验知识,也不需要重新训练模型,而是通过构建正交零空间,并将 LoRA 更新投影到该零空间中,以削弱或移除后门影响。研究称,该方法可将攻击成功率从接近100%降至10%以下,同时保留基座模型能力与下游任务技能。相关成果已提交至 NeurIPS 2026。
AI 根据报道生成 · 1 小时前更新
最新进展10月2日 12:00
研究提出零空间投影方法,可将LoRA微调模型后门攻击成功率降至10%以下。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- arXiv cs.AI基于零空间投影的 LoRA 微调大语言模型后门净化方法
该研究提出一种无需触发器先验知识或重新训练即可净化 LoRA 微调大语言模型后门的方法。通过构建正交零空间并投影 LoRA 更新,该方法将攻击成功率从近 100% 降至 10% 以下,同时保留基座模型能力与下游任务技能。相关成果已提交至 NeurIPS 2026。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。