跳到正文
热点事件持续更新

零空间投影净化LoRA微调LLM后门

1 篇报道1 个报道来源11 小时前更新

先了解这件事

AI 综述

2026年10月2日,arXiv cs.AI 发布研究,提出一种针对 LoRA 微调大语言模型后门净化的方法。该方法不需要触发器先验知识,也不需要重新训练模型,而是通过构建正交零空间,并将 LoRA 更新投影到该零空间中,以削弱或移除后门影响。研究称,该方法可将攻击成功率从接近100%降至10%以下,同时保留基座模型能力与下游任务技能。相关成果已提交至 NeurIPS 2026。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv cs.AI
    基于零空间投影的 LoRA 微调大语言模型后门净化方法

    该研究提出一种无需触发器先验知识或重新训练即可净化 LoRA 微调大语言模型后门的方法。通过构建正交零空间并投影 LoRA 更新,该方法将攻击成功率从近 100% 降至 10% 以下,同时保留基座模型能力与下游任务技能。相关成果已提交至 NeurIPS 2026。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。