arXiv cs.AI· Andre Fu, Malik Drabla, Leon Liu, Meji Abidoye, Marek Suppa, Lata Mishra, Adnan El Assadi, Yiyuan Li·· 12 小时前AI 评分72
Incident-Arena 发布:20个真实生产任务测试显示AI智能体故障修复成功率低于64.3%
Incident-Arena: Getting agents to the last nine of reliability
AI 摘要
arXiv cs.AI 发布的 Incident-Arena 基准测试针对 AI 编码智能体在生产环境故障响应(agentic SRE)中的可靠性,包含20个基于真实开源软件构建的任务。该基准通过部署应用至临时 Kubernetes 集群、注入配置层及镜像层故障并施加持续负载,模拟真实生产场景,采用功能验证器而非静态检查来确保系统级指标稳定及修复安全性。
测试结果显示,跨3种应用底座的20个任务中,前沿模型得分均低于64.3%。失败原因涵盖诊断与定位错误、修复不完整以及引入不安全的回归。智能体平均消耗2.81M tokens并经历41轮交互,证明了长程推理需求远超现有基准设定。
事实层面,该研究证实当前模型在处理复杂生产故障时存在显著能力缺口;推断层面,这意味着将智能体直接应用于关键基础设施运维仍面临高风险,需解决长上下文下的稳定性问题;猜测层面,若无法突破此瓶颈,行业对“全自动运维”的商业化时间表可能需重新评估。
来源:arXiv cs.AI · arxiv.org