arXiv cs.CR· Kavienan Jegatheesan, Gayathri Lihinikaduarachchi·· 5 小时前AI 评分70
数学智能体在工具反馈被静默污染下的可靠性与验证策略有效性研究
When Tools Lie: Reliability of Mathematical Agents Under Corrupted Tool Feedback
AI 摘要
该研究通过受控框架评估数学智能体在工具返回看似合理但错误结果时的表现,发现无验证机制时准确率从100%骤降至72.4%,而强制同上下文反思能完全恢复至100%。实验表明,验证器的可用性本身并不等同于可靠性,关键在于验证策略是强制还是可选:强制策略能确保检查执行,而可选策略依赖模型主动调用,若模型未选择调用则无法获得鲁棒性提升。
核心证据来自31个问题的测试集,其中隐藏拦截器替换了目标问题的工具输出。结果显示,仅在模型主动触发可选验证时准确率才有所改善,且验证频率与鲁棒性差异强相关。此外,支持性恢复实验证明,一旦明确检测到错误并重启整个问题流程,成功率可达100%。这区分了验证器存在性与验证政策作为独立组件的作用,指出当前Agent架构中过度依赖模型自主决策可能导致关键校验步骤缺失。
事实层面,本研究确认了工具静默失败对数学推理的破坏力及强制反思的有效性;推断层面,这意味着构建高可靠Agent系统不能仅依赖模型自我判断,必须引入硬性约束或外部审计机制;猜测层面,若将此类逻辑迁移至代码生成或RAG场景,类似的安全漏洞可能同样存在,需警惕“可信工具”假设带来的系统性风险。
来源:arXiv cs.CR · arxiv.org