arXiv cs.AI· Chenglin Yang·· 5 小时前AI 评分72
评估堆栈而非层级:确定性规则与 LLM 网关在 Agent 动作拦截中并非独立失效
Evaluate the Stack, Not the Layer: Do Deterministic and LLM Gates for Agent Actions Fail Independently?
AI 摘要
该研究通过 1,119 个标注的 Agent 动作数据,测试了由一层确定性规则和四层 LLM 裁判组成的运行时门控堆栈,发现其错误率并不符合“误差独立相乘”的常见假设。在 STRICT 定义下(将升级给人工视为未拦截),任意两个裁判组合仅相当于 1.2 到 1.4 层等效防护,而规则层加一个裁判的组合也仅达到 1.86 到 2.09 层,远低于理论叠加值。这表明多层级联的 Gate 机制在实际部署中并未带来预期的线性安全增益。
关键证据显示,单一裁判的准确率无法预测其在堆栈中的实际贡献,例如某云规则包虽将自身误报率降低 20%,却未增加联合覆盖率。更严重的是,实验过程中出现了一次模型版本错配事件:50 批次中有 112 次被外部裁判服务使用了未请求的版本,这一事实直接导致五处结论反转,迫使作者重新发布分析结果。这揭示了依赖外部 API 或动态模型服务的架构存在不可控的变量风险。
推断认为,当前基于“堆叠即增强”逻辑设计的 Agent 安全方案可能高估了防御深度,实际防护能力受限于裁判间的强耦合性。猜测部分指出,若未来引入更多异构裁判,若不解决版本一致性和数据分布对齐问题,反而可能因内部冲突降低整体鲁棒性。事实层面确认了误差非独立性、版本错配影响显著以及单点精度无效;推断层面指向架构设计需从数量堆叠转向质量校准;猜测层面涉及异构裁判的潜在负面效应。
来源:arXiv cs.AI · arxiv.org