跳到正文
原文
AWS Machine Learning Blog· Huibin Shen·· 2 小时前精选AI 评分80

AWS 用 Amazon SageMaker AI MTRL 微调 Qwen3.6-27B 搜索智能体

Fine-tune a search agent with multi-turn RL on Amazon SageMaker AI

AI 导读

AWS 发布教程展示如何使用 Amazon SageMaker AI 的多步强化学习(MTRL)功能,对 Qwen3.6-27B 模型进行微调以构建企业级搜索智能体。该方法无需专家演示数据或复杂的算法调优,仅通过设置三个超参数即可在服务器端架构上完成训练,最终在多个基准测试中显著提升了检索质量并大幅降低了任务失败率。

核心证据显示,该方案在 BrowseComp-Plus 基准上将 nDCG@10 指标提升了 23.7%,同时将任务失败率从 22.89% 骤降至 0.68%。这主要得益于其独特的奖励函数设计:直接使用 nDCG@10 作为轨迹级奖励信号,并对超出最大轮次或 Token 限制的情况施加 -1 的惩罚,从而教会模型在预算内高效完成任务。此外,训练过程支持断点续训和异步 rollout,使得长周期训练更加稳定且易于管理。

这一实践表明,利用云原生的无服务器基础设施和默认配置,开发者可以绕过传统强化学习的高门槛,直接针对特定业务场景优化小模型的推理能力。事实层面,Qwen3.6-27B 经过微调后在 WixQA 和 BrowseComp-Plus 等数据集上表现优异;推断层面,这种低代码、按 Token 付费的模式可能成为未来企业 Agent 开发的主流路径;猜测层面,随着更多垂直领域数据的接入,此类微调方法有望进一步缩小通用大模型与专用智能体之间的性能差距。

推荐理由

通过最小化配置实现多步强化学习微调,将复杂任务失败率从22.89%降至0.68%,为构建低成本高可靠Agent提供可复用的工程范式。

来源:AWS Machine Learning Blog · aws.amazon.com