跳到正文

#Hugging Face

今日 0 条
10月2日周五
  1. Hugging Face Blog72

    AllenAI 开源 AstaBrief 8B:基于 Qwen3-8B 微调的科学报告生成模型

    AllenAI 正式开源了名为 AstaBrief 的 8B 参数模型,该模型基于 Qwen3-8B 构建,专为从检索到的文献片段中快速生成带引用的科学研究报告而设计。作为其 Agentic 平台 Asta 中的“Fast”模式核心,AstaBrief 旨在解决通用大模型在科学工作中证据 grounding 不足的问题,同时显著降低生成延迟和算力成本。 训练策略上,团队放弃了不稳定的强化学习(RL),转而采用监督微调(SFT)结合直接偏好优化(DPO)。数据方面,他们清洗了 90,000 条来自真实科研人员的查询日志,利用 Claude 3.5 Sonnet、o3 等模型生成了 47,000 个高质量 SFT 样本,并构建了约 6,000 对 DPO 偏好数据。关键的技术细节在于引入了“引用密度”(Citation Density)过滤器,剔除那些引用稀疏或过度依赖少数文献的合成报告,从而强制模型在生成时保持对证据的忠实度。 性能评估显示,AstaBrief 在 SQABench-CS2 基准上与闭源模型相当,且在人类研究中表现出优于其他系统的引用准确性。在实际部署中,Fast 模式的平均报告生成时间为 51.1 秒,相比使用 Claude 的 Thinking 模式(178.5 秒)快了约 3.5 倍。目前已有 23% 的用户在尝试后选择永久切换至 Fast 模式,验证了其在特定垂直领域的实用性与效率优势。

    推荐理由:通过 90K 真实查询与引用密度过滤,证明 SFT+DPO 在科学综述场景可替代昂贵 RL,且 Fast 模式生成速度提升 3.5 倍。

  2. Hugging Face Blog78

    ServiceNow AutoSynthData 将 Agent 失败转为经验证的合成训练数据,Hybrid 域 Pass@1 相对提升 35%

    ServiceNow CoreAI 的 AutoSynthData 把目标模型在企业环境中的失败与更强教师模型的成功转化为经环境验证的合成训练任务,用于监督微调;在 EnterpriseOps Gym 的 Hybrid 域以 Gemma-4-26B-A4B-it 为目标、Qwen3.8-27B 为教师,约 18 小时生成 2,000 个样本,微调后平均 Pass@1 提升 7.2 个百分点(相对 35%),verifier 成功率从 63.01% 升至 68.55%,并弥补了目标模型与参考模型之间 59% 的原始 Pass@1 差距。在 ITSM 域以 DeepSeek-V4.1-Flash 为教师生成 1,994 个样本耗时 66 小时,Pass@1 从 18.77% 升至 27.18%。 机制上有几个容易被略过的设计:任务被抽象为 system specification、user prompt 与 verifier 三元组,筛选配置偏好目标模型三次试验中解决不超过一次、教师至少解决两次的候选;每个候选要过正向验证(参考轨迹能否解任务)、负向验证(被篡改的错误结果是否被 verifier 拒绝)和有限次修复;multiply 阶段产生的变体不能再作为种子生成下一代变体,从而把扩展锚定在已验证的 target 集合上限制漂移;生成器只接收消毒后的能力规格卡,拿不到原始评测任务的提示词、实体、轨迹或 verifier 细节,训练提升因此不是来自对评测题的记忆。 事实是兩個域的提升都来自新生成任务且经过执行级验证;推断是该方法把合成数据从生成量问题变成带反馈控制的搜索问题,真正稀缺的是质量门控与难度校准,做企业 Agent 微调的团队可以直接复用其验证 gate 与批次级覆盖审查来约束数据分布;猜测层面,作者称同一机制可支持强化学习并计划测试移动的难度边界,但 RL 场景的收益尚未验证,不应据此预期强化学习训练会得到同样幅度的改善。

    推荐理由:材料把合成数据生成的质量门控拆到样本级正负验证与批次级覆盖审查,并给出难度校准筛选阈值,能校正合成数据靠堆量的判断,为企业 Agent 微调提供可复用的验证设计。