微软亚洲研究院发布 Agent Lightning v1.0:基于真实 Harness 的轻量级智能体强化学习框架
Agent Lightning v1.0: A 3,500-Line Lightweight Agentic RL Framework for Training Agents with Real Harnesses
微软亚洲研究院开源了 Agent Lightning v1.0,这是一个仅约 3,500 行代码的轻量级智能体强化学习(RL)框架,旨在解决现有系统因在训练框架内重实现 Agent 而导致的行为偏差和开发成本高昂的问题。
该框架采用“Harnessed Agentic RL”范式,允许部署时使用的真实 Agent Harness 直接参与训练过程,无需重新编写交互逻辑。通过 API Gateway、Rollout Controller 和 Customized Trainer 三个核心组件,系统实现了 Collocated Async RL 机制,使推理与训练共享 GPU 资源,相比同步 RL 实现了约 2 倍的整体加速,同时比传统异步方案占用更少的 GPU。此外,框架原生支持 Kubernetes,可直接在自管理集群或本地基础设施上运行 Agent,摆脱了对 Modal Sandbox 等商业沙盒服务的依赖。
在 Qwen3.5-9B 模型上的编码智能体实验显示,使用约 6,000 个训练样本,Pass@1 指标从 41.8% 提升至 56.4%,绝对增益达 14.6 个百分点。这一结果验证了该框架在数据效率和性能提升方面的有效性,为构建低成本、可复现的智能体训练流水线提供了新的工程路径。
框架以 3500 行代码实现真实 Harness 的 RL 训练,解决了传统方法需重写 Agent 逻辑导致的部署偏差与成本问题。
来源:Microsoft Research · microsoft.com