跳到正文
热点事件持续更新

DeepSeek V4 Pro在科学预测基准中表现未达预期

1 篇报道1 个报道来源8 小时前更新

先了解这件事

AI 综述

2026年10月2日,arXiv cs.AI发布研究《预测信用:衡量科学解释对实验预测的贡献》。该研究通过配对预测与干预变量,评估科学解释对实验预测的增量贡献。在Tox21和OpenML任务中,DeepSeek V4 Pro将次要漂移降低约60%,但Flash版本未达区间等价性。研究者构建的正向控制机制使点误差MAE降低2.60个百分点,而自然解释信用在测试分辨率下仍未获确认。目前,该事件尚无早先报道可供对比。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv cs.AI
    预测信用:衡量科学解释对实验预测的贡献

    研究通过配对预测与干预变量,评估科学解释对实验预测的增量贡献。在 Tox21 和 OpenML 任务中,DeepSeek V4 Pro 将次要漂移降低约 60%,但 Flash 版本未达区间等价性;研究者构建的正向控制机制使点误差 MAE 降低 2.60 个百分点,而自然解释信用在测试分辨率下仍未获确认。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。