跳到正文
原文
arXiv cs.AI· Min Zeng, Rui Zhang·· 4 小时前AI 评分72

论文指出大语言模型在患者证据演变时无法可靠更新临床判断

Large language models exhibit unreliable updating of clinical judgment as patient evidence evolves

AI 摘要

该研究评估了多种大语言模型(LLMs)在重症监护轨迹中随患者证据演变而进行纵向信念更新的能力,发现模型在调整预测时往往增加而非减少误差。通过电子健康记录匹配数据,研究证实当模型基于先前判断进行条件预测时,其错误率反而上升,且这种模式在第二个终点上得到复现。

干预实验揭示了两种具体的失效模式:首先,在固定先前评估的情况下,模型对恶化的呼吸证据反应强于同等程度的改善证据,这种不对称性在中等和强证据水平下经归一化后依然存在;其次,在固定当前证据的情况下,将先验风险从10%提升至90%会导致估计值偏移26.2个百分点,证明模型先验信念具有因果影响力。提示工程(Prompting)未能恢复可靠的更新机制。

研究提出的证据验证纵向更新(EVLU)指标识别出更少但更可靠的修订,揭示了可靠性与覆盖率之间的权衡。事实层面确认了LLM在动态医疗场景中缺乏理性修正能力;推断层面表明现有模型难以胜任需要持续整合新证据的临床决策辅助;猜测层面认为若将此结论推广至其他高风险动态领域,可能需重新定义“智能体”在长周期任务中的信任边界。

来源:arXiv cs.AI · arxiv.org