跳到正文
原文
arXiv cs.CR· Miaobo Hu, Shuhao Hu, Xiaobo Guo, Xin Wang, Bokun Wang, Yina Sa, Daren Zha, Jun Xiao·· 11 小时前精选AI 评分78

可重放工具智能体审计收据联合绑定声明、证据与执行,并在 1,280 次跨对象攻击中检测出 1,275 次替换。

Actions with Receipts: Jointly Binding Claims, Evidence, and Execution for Replayable Tool-Agent Auditing

AI 导读

论文提出可重放工具智能体审计收据,联合绑定声明、来源片段、执行前缀和来源版本。它针对的问题不是引用或执行日志单独无效,而是两者都形式有效时,声明仍可能被移植到不同声明、动作、运行或来源版本。该合同把展示给用户的 claim 与产生它的 committed execution 和 cited source 关联起来,使审计不再只检查引用和 trace 是否 well formed。

收据包含 emission anchor,用于在 committed answer 或 claim-bearing action 中定位 claim,并携带 source identifiers、offsets、hashes、quotes 和 domain-separated execution commitment。确定性 integrity verifier 在语义或任务标签 join 前重建这些绑定,并把 integrity plane 与可插拔 support plane 分开,避免把结构有效性当作 entailment 的代理。论文列出七个可独立测试属性,包括 claim-emission binding、source binding、ordered-execution binding、oracle separation、persisted-object replay、execution-rerun consistency 和 version/access binding。

在 1,280 次 cross-object attacks 中,联合合同检测出 1,275 次 substitutions,检测率为 0.9961;移除某个 targeted property 后,对应攻击检测率降到 0.0156-0.0625。在独立 adjudicated 的 384-pair split 上,conflict-aware support guard 的 F1 为 0.8865,false acceptance 为 0.0729;在 unseen failure families 上分别为 0.8679 和 0.0938。事实是论文报告了这些指标;推断是,对需要引用可追溯的 Agent 产品,审计重点应从引用和日志是否完整转向声明、执行与来源版本是否同一;猜测是,实际部署需要维护 source version、access state 和 execution commitment,可能增加工程成本,但能降低跨对象替换造成的误导风险。

推荐理由

它把工具智能体的引用、执行与来源版本绑定为可重放收据,能校正只查日志和引用是否有效的审计判断。

来源:arXiv cs.CR · arxiv.org