Fiorillo v0.5 基于 Qwen3-4B 在随机试验推断任务中通过四项注册标准验证
Calibrated Answers About Randomized Trials From a 4-Billion-Parameter Open Model: A Registered Test and a License-Clean Release
Fiorillo v0.5 是一个基于 Qwen3-4B-Base 微调的开源模型,专为从随机对照试验文章中回答结构化问题而设计,其核心能力是输出每个答案的概率而非单一结论。该模型针对证据推断(EI)任务进行了微调,仅使用 1,431 篇许可允许复用的训练文章,输入被截断至 6,144 tokens。发布前已在开放科学框架注册了四项评估标准,并在测试集上全部通过。
在包含 333 篇文章、1,218 个提示词的测试集上,模型的预期校准误差为 0.0168,低于 0.05 的阈值;对数损失比 Gemma 4 31B-it 低 0.1829,宏观 F1 分数达到 0.9248。实验显示,若移除文章正文,宏观 F1 骤降至 0.4384,仅凭标题可使指标提升 0.0939,且交换干预措施与比较对象会导致 0.6652 的方向性答案反转。代码、结果文件及模型权重已随 Apache License 2.0 协议公开。
事实层面,该研究证实了小参数模型在特定垂直领域经过严格数据筛选和微调后,能达到接近大模型的统计校准水平。推断层面,这表明在医疗等高风险领域,概率输出结合严格的上下文窗口限制可能比单纯追求参数量更能保障决策的可解释性与安全性。猜测层面,这种基于注册标准的发布模式可能成为未来 AI 在受监管行业落地的新范式,但需观察其在更广泛临床场景中的泛化表现。
材料以注册标准验证了 4B 模型在随机试验推断上的校准度,为小模型医疗场景应用提供了可复现的基准。
来源:arXiv cs.CL · arxiv.org