论文指出Agent安全基准中威胁相关命名可导致攻击成功率测量值大幅波动
Threat-Preserving Representation Sensitivity in Agent-Security Benchmarks
该研究提出威胁保持表示敏感性(TPRS)指标,证明在保持任务、危害动作和安全策略不变的前提下,仅改变智能体可见的工具名称表示,即可导致攻击成功率(ASR)发生显著变化。在Agent Security Bench (ASB)上,将威胁相关工具名替换为中性名称后,GPT-5-mini的ASR上升了11.67个百分点,Claude Haiku 4.5上升了13.21个百分点;而在MCPTox基准中,将中性名称改为显式威胁名称则使GPT-5-mini的ASR下降了11.00个百分点。
实验进一步发现,这种偏差并非完全由语义差异引起,而是与词形特征高度相关。在MCPTox实验中,当使用长度、大小写和Token数量匹配的中性名称时,仍能复现约8.54个百分点的ASR变化(占原始11.00个百分点变化的绝大部分)。此外,在AgentDojo基准中,虽然添加威胁措辞对ASR影响较小(仅0.50个百分点),但导致需要该工具的良性任务效用下降了5.36个百分点,显示出评估指标间的权衡。
事实层面,单一表示下的安全评分无法泛化到同一安全问题的其他威胁保持表示形式。推断层面,当前广泛使用的基于单一表示的鲁棒性声明缺乏充分支撑,可能高估或低估模型真实安全性。建议行业在发布安全结论时,必须提供跨受控威胁保持表示集的性能数据,而非依赖单一分数。猜测层面,若现有主流基准未进行此类多表示测试,其排名结果可能存在系统性偏差,但这需等待更多基准验证。
揭示工具命名方式可致ASR波动超13个百分点,校正对模型鲁棒性评估单一指标的依赖。
来源:arXiv cs.CR · arxiv.org