arXiv cs.CR· Qiusi Zhan, Nian Lyu, Stephanie Ding, Arnav Mehta, Xander Davies, Daniel Kang·· 5 小时前精选AI 评分78
Qwen2.5-Coder-7B上RL训练反而增强后门持久性并提升攻击成功率至76%
Understanding and Enhancing Backdoor Persistency in LLM Agent Post-Training
AI 导读
该论文针对软件工程师类LLM Agent的供应链威胁,实证研究了良性监督微调(SFT)和后续任务级强化学习(RL)对植入后门的影响。研究发现,虽然SFT会显著降低攻击成功率,但随后的RL阶段往往保留甚至增强了残留的后门行为。
在Qwen2.5-Coder-7B模型上的实验显示,作者提出的PersistBD方法将SFT后的攻击成功率从20%提升至74%,并在SFT-RL流程后进一步升至76%,同时保持了与原始模型相当的良性任务性能。分析指出,初始后门强度和梯度与良性训练的兼容性是决定后门能否在SFT中幸存的两个关键因素。
事实层面确认了后门可穿透良性后训练过程;推断表明当前基于SFT的安全清洗策略存在盲区,RL优化目标可能与后门触发机制产生冲突或协同;猜测认为若开发者未引入专门检测机制,依赖第三方模型构建Agent时将面临隐蔽的供应链风险。
推荐理由
揭示RL阶段可能强化后门而非消除,直接修正对SFT后模型安全的常规判断。
来源:arXiv cs.CR · arxiv.org