跳到正文
热点事件持续更新

AWS发布SageMaker AI多轮强化学习功能微调搜索智能体

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月2日,AWS在机器学习博客发布教程,展示如何使用Amazon SageMaker AI的多步强化学习(MTRL)功能微调Qwen3.6-27B模型以构建企业级搜索智能体。该方法无需专家演示数据或复杂调优,仅需设置三个超参数即可在服务器端完成训练。报道指出,该方案在BrowseComp-Plus基准测试中将nDCG@10指标提升了23.7%,并大幅降低了任务失败率。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. AWS Machine Learning Blog精选
    AWS 用 Amazon SageMaker AI MTRL 微调 Qwen3.6-27B 搜索智能体

    AWS 发布教程展示如何使用 Amazon SageMaker AI 的多步强化学习(MTRL)功能,对 Qwen3.6-27B 模型进行微调以构建企业级搜索智能体。该方法无需专家演示数据或复杂的算法调优,仅通过设置三个超参数即可在服务器端架构上完成训练,最终在多个基准测试中显著提升了检索质量并大幅降低了任务失败率。 核心证据显示,该方案在 BrowseComp-Plus 基准上将 nDCG@10 指标提升了 23.7%,同时将任务失败率从 22.89% 骤降至 0.68%。这主要得益于其独特的奖励函数设计:直接使用 nDCG@10 作为轨迹级奖励信号,并对超出最大轮次或 Token 限制的情况施加 -1 的惩罚,从而教会模型在预算内高效完成任务。此外,训练过程支持断点续训和异步 rollout,使得长周期训练更加稳定且易于管理。 这一实践表明,利用云原生的无服务器基础设施和默认配置,开发者可以绕过传统强化学习的高门槛,直接针对特定业务场景优化小模型的推理能力。事实层面,Qwen3.6-27B 经过微调后在 WixQA 和 BrowseComp-Plus 等数据集上表现优异;推断层面,这种低代码、按 Token 付费的模式可能成为未来企业 Agent 开发的主流路径;猜测层面,随着更多垂直领域数据的接入,此类微调方法有望进一步缩小通用大模型与专用智能体之间的性能差距。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。