跳到正文
原文
arXiv cs.CR· Zhuowen Liu·· 6 小时前AI 评分75

论文指出基于公开基准的提示注入检测器在真实 Agent 环境中失效且排名不可迁移

Passing the Test You Trained On: Re-evaluating Prompt-Injection Detectors for LLM Agents

AI 摘要

该研究通过重放 AgentDojo 和 tau-bench 两个基准的真实工具调用数据,发现十五种提示注入检测器的性能排名在不同基准间几乎无法迁移。在 BIPIA 上表现最佳的检测器在 AgentDojo 中仅能以 1% 的误报率捕获 2% 的注入,而在 tau-bench 上捕获率仅为 15%,证明依赖公共排行榜选择检测器存在严重误导。

核心证据在于训练数据的分布差异:BIPIA 榜首模型虽见过 InjecAgent 的短攻击串,但因未接触长上下文工具输出而失效;相反,在两个 Agent 基准上表现最好的模型完全未使用任何基准数据,而是专门针对 Agent 风格的输入进行训练。此外,虽然不同基准间的误报率在工具输出上的表现具有可迁移性(范围从 0% 到超过 90%),但检出率的不可迁移性直接否定了当前以基准分数作为选型依据的行业惯例。

事实层面,现有评估体系未能反映 Agent 内部的实际防御能力;推断层面,团队若继续依赖 BIPIA 等榜单采购或配置检测模块,将面临极高的漏报风险;猜测层面,未来合规审计将强制要求披露检测器的具体训练语料构成及在特定工具输出上的低误报率实测数据,而非仅展示通用基准得分。

来源:arXiv cs.CR · arxiv.org