跳到正文
原文
Hugging Face Blog·· 2 小时前精选AI 评分72

AllenAI 开源 AstaBrief 8B:基于 Qwen3-8B 微调的科学报告生成模型

Open-sourcing AstaBrief, the fast report-generation model in Asta

AI 导读

AllenAI 正式开源了名为 AstaBrief 的 8B 参数模型,该模型基于 Qwen3-8B 构建,专为从检索到的文献片段中快速生成带引用的科学研究报告而设计。作为其 Agentic 平台 Asta 中的“Fast”模式核心,AstaBrief 旨在解决通用大模型在科学工作中证据 grounding 不足的问题,同时显著降低生成延迟和算力成本。

训练策略上,团队放弃了不稳定的强化学习(RL),转而采用监督微调(SFT)结合直接偏好优化(DPO)。数据方面,他们清洗了 90,000 条来自真实科研人员的查询日志,利用 Claude 3.5 Sonnet、o3 等模型生成了 47,000 个高质量 SFT 样本,并构建了约 6,000 对 DPO 偏好数据。关键的技术细节在于引入了“引用密度”(Citation Density)过滤器,剔除那些引用稀疏或过度依赖少数文献的合成报告,从而强制模型在生成时保持对证据的忠实度。

性能评估显示,AstaBrief 在 SQABench-CS2 基准上与闭源模型相当,且在人类研究中表现出优于其他系统的引用准确性。在实际部署中,Fast 模式的平均报告生成时间为 51.1 秒,相比使用 Claude 的 Thinking 模式(178.5 秒)快了约 3.5 倍。目前已有 23% 的用户在尝试后选择永久切换至 Fast 模式,验证了其在特定垂直领域的实用性与效率优势。

推荐理由

通过 90K 真实查询与引用密度过滤,证明 SFT+DPO 在科学综述场景可替代昂贵 RL,且 Fast 模式生成速度提升 3.5 倍。

来源:Hugging Face Blog · huggingface.co