Hugging Face Blog·· 4 小时前精选AI 评分70
Ai2 用 GPU 时间预算和最小运行时契约解决集群调度难题
Impactful scheduling for GPU clusters
AI 导读
Ai2 基础设施团队将基于优先级的调度系统替换为包含 GPU 时间预算、分层公平共享分配和时间切片契约的新系统,成功解决了 GPU“占位”(squatting)、优先级通胀以及人工维护成本高等问题。新机制要求所有请求必须由预算资助,否则不受抢占保护,并将管理重心从个案操作转向透明的行政预算流程,使得高价值工作负载能更稳定地获得资源。
实施细节显示,该方案引入了分层公平共享算法,以 7 天滑动窗口跟踪占用率,并允许未分配的工作负载在空闲时填充集群,从而维持了 98% 的集群占用率。最关键的改进在于“调度契约”,强制工作负载声明最小运行时间(默认 8 小时),在此期间受保护,超时后可被自动抢占和重排队。这一机制直接导致需要人工介入的修复活动减少了 74%,且调试工作负载的 p90 队列等待时间从 2 小时降至 30 秒。
尽管整体效果显著,但该系统对交互式会话产生了副作用,因为长时间运行的会话现在受到 8 小时保护上限的限制,一旦超过即可能被抢占且状态丢失。为此,Ai2 计划建设专用的 CPU 集群用于开发任务,并构建可恢复的会话功能。事实层面,30 天测试期内团队获得了 98% 的应得 GPU 时长;推断层面,这种预算驱动的模式可能成为大型实验室应对算力稀缺的标准范式;猜测层面,未来需警惕最小运行时间保护导致的容量碎片化问题,这可能会增加超大工作负载的排队延迟。
推荐理由
通过 GPU 时间预算与最小运行时契约,将调度博弈转化为透明行政流程,使调试等待时间从小时级降至秒级。
来源:Hugging Face Blog · huggingface.co