Ai2 引入 GPU 时间预算与分层公平分配调度系统
先了解这件事
2026年10月9日,Hugging Face Blog报道了Ai2基础设施团队的新进展。该团队将原有的基于优先级的调度系统替换为包含GPU时间预算、分层公平共享分配和时间切片契约的新系统。新机制要求所有请求必须由预算资助,否则不受抢占保护,旨在解决GPU“占位”、优先级通胀及人工维护成本高等问题。实施细节显示,方案引入了分层公平共享算法,通过7天滑动窗口跟踪占用率,并允许未分配的工作负载在空闲时利用资源。这一转变使管理重心从个案操作转向透明的行政预算流程,确保高价值工作负载能更稳定地获得资源。
AI 根据报道生成 · 3 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- Hugging Face Blog精选Ai2 用 GPU 时间预算和最小运行时契约解决集群调度难题
Ai2 基础设施团队将基于优先级的调度系统替换为包含 GPU 时间预算、分层公平共享分配和时间切片契约的新系统,成功解决了 GPU“占位”(squatting)、优先级通胀以及人工维护成本高等问题。新机制要求所有请求必须由预算资助,否则不受抢占保护,并将管理重心从个案操作转向透明的行政预算流程,使得高价值工作负载能更稳定地获得资源。 实施细节显示,该方案引入了分层公平共享算法,以 7 天滑动窗口跟踪占用率,并允许未分配的工作负载在空闲时填充集群,从而维持了 98% 的集群占用率。最关键的改进在于“调度契约”,强制工作负载声明最小运行时间(默认 8 小时),在此期间受保护,超时后可被自动抢占和重排队。这一机制直接导致需要人工介入的修复活动减少了 74%,且调试工作负载的 p90 队列等待时间从 2 小时降至 30 秒。 尽管整体效果显著,但该系统对交互式会话产生了副作用,因为长时间运行的会话现在受到 8 小时保护上限的限制,一旦超过即可能被抢占且状态丢失。为此,Ai2 计划建设专用的 CPU 集群用于开发任务,并构建可恢复的会话功能。事实层面,30 天测试期内团队获得了 98% 的应得 GPU 时长;推断层面,这种预算驱动的模式可能成为大型实验室应对算力稀缺的标准范式;猜测层面,未来需警惕最小运行时间保护导致的容量碎片化问题,这可能会增加超大工作负载的排队延迟。
本事件热度走势
当前热度 9·可比范围峰值 10(10月10日 01:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。