跳到正文
热点事件持续更新

LLM Agent 提示注入检测器在真实工具输出上表现失效

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

2026年10月5日,一项新研究指出基于公开基准的提示注入检测器在真实Agent环境中失效且排名不可迁移。该研究重放了AgentDojo和tau-bench两个基准的真实工具调用数据,发现十五种检测器的性能排名在不同基准间几乎无法迁移。具体而言,在BIPIA上表现最佳的检测器,在AgentDojo中仅能以1%的误报率捕获2%的注入,而在tau-bench上捕获率仅为15%。研究认为这证明依赖公共排行榜选择检测器存在严重误导,核心证据在于训练数据的分布差异:BIPIA榜首模型虽见过InjecAgent的短攻击串,但未能适应真实场景。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv cs.CR
    论文指出基于公开基准的提示注入检测器在真实 Agent 环境中失效且排名不可迁移

    该研究通过重放 AgentDojo 和 tau-bench 两个基准的真实工具调用数据,发现十五种提示注入检测器的性能排名在不同基准间几乎无法迁移。在 BIPIA 上表现最佳的检测器在 AgentDojo 中仅能以 1% 的误报率捕获 2% 的注入,而在 tau-bench 上捕获率仅为 15%,证明依赖公共排行榜选择检测器存在严重误导。 核心证据在于训练数据的分布差异:BIPIA 榜首模型虽见过 InjecAgent 的短攻击串,但因未接触长上下文工具输出而失效;相反,在两个 Agent 基准上表现最好的模型完全未使用任何基准数据,而是专门针对 Agent 风格的输入进行训练。此外,虽然不同基准间的误报率在工具输出上的表现具有可迁移性(范围从 0% 到超过 90%),但检出率的不可迁移性直接否定了当前以基准分数作为选型依据的行业惯例。 事实层面,现有评估体系未能反映 Agent 内部的实际防御能力;推断层面,团队若继续依赖 BIPIA 等榜单采购或配置检测模块,将面临极高的漏报风险;猜测层面,未来合规审计将强制要求披露检测器的具体训练语料构成及在特定工具输出上的低误报率实测数据,而非仅展示通用基准得分。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。