小米 MiMo-V2.6 技术报告披露规模化强化学习路线与成本结构
单次RL后训练烧掉260万美元、每步37亿Token,小米披露MiMo-V2.6“规模化强化学习”路线
小米 MiMo 团队发布《MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement》技术报告,披露了一套完整的规模化 Agentic RL 训练过程及两个模型版本:MiMo-V2.6-Pro(总参数 1.02T)和 MiMo-V2.6-Flash(总参数 310B)。该工作通过扩大 Rollout、环境和 Grader Compute 规模,探索模型持续自我改进的路径,并在 DeepSWE v1.1 等未进入训练集的测试中实现了约 14-17 分的性能提升。
报告详细量化了训练成本与架构细节,单次 RL 后训练烧掉 260 万美元,其中 Pro 版本的 Grader 成本占比达 12.7%。在工程实践中,团队发现 MoE Router 若跟随 RL 更新会在 20 步内发生负载漂移,因此选择冻结 Router;同时引入了 Groupwise Reward Synthesis 和 Hack Agent 机制来防止 Reward Hacking,将作弊轨迹比例控制在 2% 以下。此外,系统重设计了 RL Infra 以支撑单 Step 2.5 万条轨迹,解决了 GPU 显存溢出和 K8s 故障等大规模训练问题。
事实层面,报告确认了开源超过 7000 个高质量 RL 环境及端到端 RL 框架。推断层面,这表明当前 AI 能力增长正从预训练 Scaling 转向 Agentic RL Scaling,即依赖人类设计好的环境与奖励机制建立反馈闭环,而非完全自主的递归自我改进。猜测层面,虽然官方宣称达到 GPT-5.6 Sol 水平,但受限于闭源对比基准的模糊性,其实际泛化能力仍需行业进一步验证。
报告拆解了 RL 后训练成本结构,揭示 Grader 算力占比超 12%,并披露 MoE Router 漂移与故障细节。
来源:InfoQ 中文 · infoq.cn