跳到正文
热点事件持续更新

LLM在临床证据演变中信念更新不可靠

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月5日,一项发表于arXiv cs.AI的研究评估了多种大语言模型(LLMs)在重症监护轨迹中随患者证据演变进行纵向信念更新的能力。研究通过电子健康记录匹配数据证实,当模型基于先前判断进行条件预测时,其错误率反而上升,且该模式在第二个终点上得到复现。干预实验揭示了两种失效模式:一是模型对恶化的呼吸证据反应强于同等程度的改善证据,这种不对称性在中等和强证据水平下经归一化后依然存在;二是研究指出模型在调整预测时往往增加而非减少误差。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv cs.AI
    论文指出大语言模型在患者证据演变时无法可靠更新临床判断

    该研究评估了多种大语言模型(LLMs)在重症监护轨迹中随患者证据演变而进行纵向信念更新的能力,发现模型在调整预测时往往增加而非减少误差。通过电子健康记录匹配数据,研究证实当模型基于先前判断进行条件预测时,其错误率反而上升,且这种模式在第二个终点上得到复现。 干预实验揭示了两种具体的失效模式:首先,在固定先前评估的情况下,模型对恶化的呼吸证据反应强于同等程度的改善证据,这种不对称性在中等和强证据水平下经归一化后依然存在;其次,在固定当前证据的情况下,将先验风险从10%提升至90%会导致估计值偏移26.2个百分点,证明模型先验信念具有因果影响力。提示工程(Prompting)未能恢复可靠的更新机制。 研究提出的证据验证纵向更新(EVLU)指标识别出更少但更可靠的修订,揭示了可靠性与覆盖率之间的权衡。事实层面确认了LLM在动态医疗场景中缺乏理性修正能力;推断层面表明现有模型难以胜任需要持续整合新证据的临床决策辅助;猜测层面认为若将此结论推广至其他高风险动态领域,可能需重新定义“智能体”在长周期任务中的信任边界。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。