跳到正文
热点事件持续更新

ServiceNow发布AutoSynthData生成企业Agent训练数据

1 篇报道1 个报道来源11 小时前更新

先了解这件事

AI 综述

2026年10月2日,Hugging Face Blog发布ServiceNow CoreAI的AutoSynthData进展。该方法将目标模型在企业环境中的失败案例与更强教师模型的成功案例结合,转化为经环境验证的合成训练任务,用于监督微调企业Agent。在EnterpriseOps Gym的Hybrid域实验中,目标模型为Gemma-4-26B-A4B-it,教师模型为Qwen3.8-27B,约18小时生成2000个样本。微调后平均Pass@1提升7.2个百分点,相对提升35%。报道还提到verifier成功率从6开始,但内容被截断,未给出完整数值。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. Hugging Face Blog精选
    ServiceNow AutoSynthData 将 Agent 失败转为经验证的合成训练数据,Hybrid 域 Pass@1 相对提升 35%

    ServiceNow CoreAI 的 AutoSynthData 把目标模型在企业环境中的失败与更强教师模型的成功转化为经环境验证的合成训练任务,用于监督微调;在 EnterpriseOps Gym 的 Hybrid 域以 Gemma-4-26B-A4B-it 为目标、Qwen3.8-27B 为教师,约 18 小时生成 2,000 个样本,微调后平均 Pass@1 提升 7.2 个百分点(相对 35%),verifier 成功率从 63.01% 升至 68.55%,并弥补了目标模型与参考模型之间 59% 的原始 Pass@1 差距。在 ITSM 域以 DeepSeek-V4.1-Flash 为教师生成 1,994 个样本耗时 66 小时,Pass@1 从 18.77% 升至 27.18%。 机制上有几个容易被略过的设计:任务被抽象为 system specification、user prompt 与 verifier 三元组,筛选配置偏好目标模型三次试验中解决不超过一次、教师至少解决两次的候选;每个候选要过正向验证(参考轨迹能否解任务)、负向验证(被篡改的错误结果是否被 verifier 拒绝)和有限次修复;multiply 阶段产生的变体不能再作为种子生成下一代变体,从而把扩展锚定在已验证的 target 集合上限制漂移;生成器只接收消毒后的能力规格卡,拿不到原始评测任务的提示词、实体、轨迹或 verifier 细节,训练提升因此不是来自对评测题的记忆。 事实是兩個域的提升都来自新生成任务且经过执行级验证;推断是该方法把合成数据从生成量问题变成带反馈控制的搜索问题,真正稀缺的是质量门控与难度校准,做企业 Agent 微调的团队可以直接复用其验证 gate 与批次级覆盖审查来约束数据分布;猜测层面,作者称同一机制可支持强化学习并计划测试移动的难度边界,但 RL 场景的收益尚未验证,不应据此预期强化学习训练会得到同样幅度的改善。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。