跳到正文
热点事件持续更新

SkillPoison 框架:渐进式投毒 AI Agent 技能

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

2026 年 10 月 7 日,arXiv cs.CR 发布论文提出 SkillPoison 攻击框架。该研究证明,即使所有输入经验均被验证为任务正确且通过词汇检查,仍能实现对自改进 LLM Agent 的渐进式技能污染。攻击者构建一组强化目标行为的成功体验,随后移除约束该行为适用场景的条件上下文,使技能提取器在泛化过程中将有用行为与有害误用绑定。实验显示,该方法在三个基准测试中达到 95.71% 的攻击成功率,且所有注入的经验在单条轨迹层面均表现为任务正确,无法被现有基于触发器或虚假事实的检测机制识别。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.CR精选
    SkillPoison 论文提出通过正常成功经验渐进式污染 AI Agent 技能的攻击框架

    该论文提出 SkillPoison 框架,证明即使所有输入经验均被验证为任务正确且通过词汇检查,仍能实现对自改进 LLM Agent 的渐进式技能污染。攻击者构建一组强化目标行为的成功体验,随后移除约束该行为适用场景的条件上下文,使技能提取器在泛化过程中将有用行为与有害误用绑定。 实验显示,该方法在三个基准测试中达到 95.71% 的攻击成功率,且所有注入的经验在单条轨迹层面均表现为任务正确,无法被现有基于触发器或虚假事实的检测机制识别。这种攻击不依赖注入恶意内容,而是利用技能提取器的泛化机制,使模型在特定情境下执行有害操作。 事实层面:攻击基于成功经验的上下文移除,非内容注入;成功率 95.71%;代码已开源。推断层面:当前技能提取流程存在系统性漏洞,常规验证机制可能失效。猜测层面:若 Agent 广泛采用此类自我改进机制,大规模部署前需重新评估技能库的安全审计标准。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。