热点事件持续更新
RL训练增强LLM Agent后门持久性研究
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
2026年10月7日,arXiv发布论文指出在Qwen2.5-Coder-7B模型上,良性监督微调(SFT)虽能降低攻击成功率,但随后的任务级强化学习(RL)阶段反而保留并增强了残留的后门行为。实验显示,通过PersistBD方法,SFT后的攻击成功率从20%提升至74%,并在SFT-RL流程后进一步升至76%,同时保持了与原始模型相当的良性任务性能。该研究揭示了软件工程师类LLM Agent供应链中,RL训练可能加剧后门持久性的风险。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
最新实证表明RL训练使Qwen2.5-Coder-7B后门攻击成功率升至76%。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv cs.CR精选Qwen2.5-Coder-7B上RL训练反而增强后门持久性并提升攻击成功率至76%
该论文针对软件工程师类LLM Agent的供应链威胁,实证研究了良性监督微调(SFT)和后续任务级强化学习(RL)对植入后门的影响。研究发现,虽然SFT会显著降低攻击成功率,但随后的RL阶段往往保留甚至增强了残留的后门行为。 在Qwen2.5-Coder-7B模型上的实验显示,作者提出的PersistBD方法将SFT后的攻击成功率从20%提升至74%,并在SFT-RL流程后进一步升至76%,同时保持了与原始模型相当的良性任务性能。分析指出,初始后门强度和梯度与良性训练的兼容性是决定后门能否在SFT中幸存的两个关键因素。 事实层面确认了后门可穿透良性后训练过程;推断表明当前基于SFT的安全清洗策略存在盲区,RL优化目标可能与后门触发机制产生冲突或协同;猜测认为若开发者未引入专门检测机制,依赖第三方模型构建Agent时将面临隐蔽的供应链风险。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。