跳到正文
原文
arXiv cs.AI· Jianwei Li, Jung-Eun Kim·· 11 小时前AI 评分42

基于零空间投影的 LoRA 微调大语言模型后门净化方法

Backdoor Purification for LoRA-Tuned LLMs via Null-Space Projection

AI 摘要

该研究提出一种无需触发器先验知识或重新训练即可净化 LoRA 微调大语言模型后门的方法。通过构建正交零空间并投影 LoRA 更新,该方法将攻击成功率从近 100% 降至 10% 以下,同时保留基座模型能力与下游任务技能。相关成果已提交至 NeurIPS 2026。

来源:arXiv cs.AI · arxiv.org