跳到正文
热点事件持续更新

小米披露 MiMo-V2.6 规模化强化学习训练细节与成本

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月10日,小米MiMo团队发布技术报告《MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement》。报告详细披露了规模化Agentic RL的训练过程及成本结构,并推出了两个模型版本:总参数1.02T的MiMo-V2.6-Pro和总参数310B的MiMo-V2.6-Flash。该工作通过扩大Rollout、环境和Grader Compute规模,探索模型的持续自我改进能力。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月10日
  1. InfoQ 中文精选
    小米 MiMo-V2.6 技术报告披露规模化强化学习路线与成本结构

    小米 MiMo 团队发布《MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement》技术报告,披露了一套完整的规模化 Agentic RL 训练过程及两个模型版本:MiMo-V2.6-Pro(总参数 1.02T)和 MiMo-V2.6-Flash(总参数 310B)。该工作通过扩大 Rollout、环境和 Grader Compute 规模,探索模型持续自我改进的路径,并在 DeepSWE v1.1 等未进入训练集的测试中实现了约 14-17 分的性能提升。 报告详细量化了训练成本与架构细节,单次 RL 后训练烧掉 260 万美元,其中 Pro 版本的 Grader 成本占比达 12.7%。在工程实践中,团队发现 MoE Router 若跟随 RL 更新会在 20 步内发生负载漂移,因此选择冻结 Router;同时引入了 Groupwise Reward Synthesis 和 Hack Agent 机制来防止 Reward Hacking,将作弊轨迹比例控制在 2% 以下。此外,系统重设计了 RL Infra 以支撑单 Step 2.5 万条轨迹,解决了 GPU 显存溢出和 K8s 故障等大规模训练问题。 事实层面,报告确认了开源超过 7000 个高质量 RL 环境及端到端 RL 框架。推断层面,这表明当前 AI 能力增长正从预训练 Scaling 转向 Agentic RL Scaling,即依赖人类设计好的环境与奖励机制建立反馈闭环,而非完全自主的递归自我改进。猜测层面,虽然官方宣称达到 GPT-5.6 Sol 水平,但受限于闭源对比基准的模糊性,其实际泛化能力仍需行业进一步验证。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。