跳到正文
原文
arXiv cs.CR· Fengpeng Li, Qizhou Wang, Yuke Hu, Kemou Li, Jun Liu, Haiwei Wu, Jiantao Zhou, Di Wang·· 10 小时前精选AI 评分78

PACE 提出面向工具型 LLM 智能体的来源感知能力执行,在 8 个可执行智能体安全基准的多数攻击列上取得最低攻击成功率

PACE: Provenance-Aware Capability Enforcement for Tool-Using LLM Agents

AI 导读

PACE 论文提出在每次工具调用执行前进行来源感知能力执行,用路径约束提出可执行的影响路径切分,并用能力与效果校验把 schema 定义的效果对照来自认证请求编译出的权限,从而在工具元数据、检索页面、记忆或可复用技能被投毒时,限制它们对下一次工具调用的影响。论文在 8 个可执行智能体安全基准和 3 个目标模型族上报告,评估配置在 79 个合格攻击列中的 62 列取得严格最低攻击成功率、14 列持平,完整基准原生效用相对无防护智能体最多损失 3 点,1167 个配对案例的完整消融把多数安全增益归因于效果校验,把拒绝控制归因于边界适配,且小规模自适应搜索对 30 个越权目标取得 0/30 成功。事实是入口审查无法区分安全变体与泄漏变体,PACE 把边界移到执行前,要求最终动作保持认证切分,并区分认证执行契约与评估配置,允许在建议阻断后恢复授权调用或应用声明修复;推断是工具调用前能力执行可能成为智能体部署的关键安全层,因为它把权限校验从静态准入移到每次副作用发生前;猜测是它能否降低真实环境中的投毒攻击仍待验证。

推荐理由

它把工具调用前的来源约束与效果校验拆成可执行边界,能校正对智能体投毒防护只能靠入口审查的判断。

来源:arXiv cs.CR · arxiv.org