Project Arena 开源 Kubernetes AI SRE 智能体基准测试工具及 Edge Delta 与 Grafana 实测数据
Show HN: AI SRE Arena, an Open Benchmark for AI SRE Agents on Kubernetes
GitHub 项目 Project Arena 发布了一个供应商中立的开源基准测试框架,用于在 Kubernetes 环境中部署临时夹具、注入故障并评估 AI SRE 智能体的调查能力。该工具支持本地 kind 或 AWS EKS 集群,包含 21 个场景的全套套件和 6 个场景的烟雾测试,通过 Python 脚本实现从故障注入、证据保存到使用 GPT-6-Astra 进行自动评分的完整流程。
在针对 Edge Delta 原生 AI 调查、Grafana 原生 AI 调查以及结合各自 CLI 使用 Claude 的对比测试中,Edge Delta 在 21 个场景中的检测率为 85.7%(18/21),而 Grafana 为 57.1%(12/21)。在根因分析指标上,Claude + edx 达到 85.7%,Claude + gcx 达到 90.5%,均高于各自平台的原生功能。最终缓解措施的支持率方面,Claude 组合表现显著优于原生方案,其中 Claude + edx 为 76.2%,Claude + gcx 为 71.4%,而 Edge Delta 原生仅为 44.4%,Grafana 原生为 41.7%。
事实层面,该基准测试由第三方社区成员 emrahsamdan 在 Hacker News 分享,代码库采用 MIT 许可,明确区分了检测率与调查质量指标。推断层面,当前数据表明通用大模型配合特定平台 API 在复杂故障诊断的“缓解建议”环节可能优于厂商内置的专用 AI 引擎,但这取决于具体场景的提示词工程和上下文窗口限制。猜测层面,若将此类基准测试标准化,可能会推动云原生监控厂商重新评估其 AI SRE 功能的开发优先级,但具体实施效果需验证不同架构下的推理延迟与成本结构。
提供可复现的 Kubernetes 故障注入与 AI 智能体评估框架,直接校正对 SRE Agent 落地能力的判断。
来源:Hacker News · AI · github.com