热点事件持续更新
DeepSeek V4 Pro在科学预测基准中表现未达预期
1 篇报道1 个报道来源8 小时前更新
先了解这件事
AI 综述
2026年10月2日,arXiv cs.AI发布研究《预测信用:衡量科学解释对实验预测的贡献》。该研究通过配对预测与干预变量,评估科学解释对实验预测的增量贡献。在Tox21和OpenML任务中,DeepSeek V4 Pro将次要漂移降低约60%,但Flash版本未达区间等价性。研究者构建的正向控制机制使点误差MAE降低2.60个百分点,而自然解释信用在测试分辨率下仍未获确认。目前,该事件尚无早先报道可供对比。
AI 根据报道生成 · 2 小时前更新
最新进展10月2日 12:00
DeepSeek V4 Pro降低次要漂移约60%,但自然解释信用未获确认。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- arXiv cs.AI预测信用:衡量科学解释对实验预测的贡献
研究通过配对预测与干预变量,评估科学解释对实验预测的增量贡献。在 Tox21 和 OpenML 任务中,DeepSeek V4 Pro 将次要漂移降低约 60%,但 Flash 版本未达区间等价性;研究者构建的正向控制机制使点误差 MAE 降低 2.60 个百分点,而自然解释信用在测试分辨率下仍未获确认。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。