InfoQ 中文· 作者: Sergio De Simone·· 4 小时前精选AI 评分78
Modal 通过重构调度与状态管理在数秒内扩展百万级并发沙箱
Modal 破解 Kubernetes 限制,在几秒内扩展 100 万个并发沙箱
AI 导读
Modal 工程师 Colin Weld 和 Connor Adams 发布文章,介绍其如何重建沙箱基础设施以支持数百万个并发沙箱及每秒数万次创建,指出 Kubernetes 等系统因强一致性中央协调(如 etcd)和 O(节点) 级负载难以在此规模下运行。该团队停止全局协调,将调度改为并行负载均衡模式,使每个工作节点成为独立数据源,并通过 RPC 直接请求创建,仅在 Redis 流中保留状态同步作为唯一瓶颈。
基准测试显示,该平台在不到一分钟内创建了 100 万个沙箱,从启动到运行代码的中位时间低于 0.5 秒,且负载测试证明在超过 10 万个工作进程时仍可行。亚马逊云科技首席 AI 工程师 Alex Jones 评论称,这一成果的关键在于 Modal 未试图扩展 Kubernetes 而是绕过了该系统,标志着生成式 AI 基础设施正朝着协调与执行脱钩的方向发展,即执行层需要毫秒级隔离边界,而协调层仍需 Kubernetes 擅长的功能。
事实层面,Modal 实现了特定架构下的性能突破;推断层面,这暗示传统容器编排平台可能无法完全满足未来高并发 AI 工作负载需求,需向更轻量级的执行层演进;猜测层面,其他项目如 Unikraft、Google Substrate 和 Overdrive 是否也会采取类似“绕过”策略尚待观察,但当前信号表明行业正在重新评估云原生架构的适用性边界。
推荐理由
揭示Kubernetes在百万级并发沙箱场景的架构瓶颈,提供绕过协调层依赖的替代方案。
来源:InfoQ 中文 · infoq.cn