跳到正文
原文
arXiv cs.CR· Lizhi Zhang, Xin He, Dianxuan Fu, Yuyuan Feng, Jiatong Li, Qi Wang, Xin Wang, Qinggang Zhang·· 5 小时前精选AI 评分78

SkillPoison 论文提出通过正常成功经验渐进式污染 AI Agent 技能的攻击框架

SkillPoison: Progressive Skill Poisoning via Successful Experiences

AI 导读

该论文提出 SkillPoison 框架,证明即使所有输入经验均被验证为任务正确且通过词汇检查,仍能实现对自改进 LLM Agent 的渐进式技能污染。攻击者构建一组强化目标行为的成功体验,随后移除约束该行为适用场景的条件上下文,使技能提取器在泛化过程中将有用行为与有害误用绑定。

实验显示,该方法在三个基准测试中达到 95.71% 的攻击成功率,且所有注入的经验在单条轨迹层面均表现为任务正确,无法被现有基于触发器或虚假事实的检测机制识别。这种攻击不依赖注入恶意内容,而是利用技能提取器的泛化机制,使模型在特定情境下执行有害操作。

事实层面:攻击基于成功经验的上下文移除,非内容注入;成功率 95.71%;代码已开源。推断层面:当前技能提取流程存在系统性漏洞,常规验证机制可能失效。猜测层面:若 Agent 广泛采用此类自我改进机制,大规模部署前需重新评估技能库的安全审计标准。

推荐理由

材料揭示无需注入恶意内容即可通过正常成功轨迹渐进式污染技能,修正对技能攻击检测有效性的判断。

来源:arXiv cs.CR · arxiv.org