arXiv cs.CL· Krithik Vishwanath, Haitong Lin, Anton Alyakin, Jin Vivian Lee, D. Brock Hewitt, Jie J. Yao, William Robert Small, Hammad A. Khan, Cordelia Orillac, Aakaash Varma, Brandon Ye, Daniel Alexander Alber, Gustavo Stolovitzky, Batia Wiesenfeld, Oded Nov, Wei Wu, Kang Zhang, Yindalon Aphinyanaphongs, Tim Requarth, Eric Karl Oermann, The International Digital Twin Consortium in Healthcare, Medicine·· 5 小时前AI 评分72
一项基于 12.7 万条真实查询的研究显示临床大模型使用场景与评测基准严重脱节
Clinician use of language models diverges from how the models are evaluated
AI 摘要
该研究通过分析 6,342 名医护人员在八个月内向机构助手发送的 127,833 条真实查询,发现当前用于评估大语言模型的主流基准与实际临床工作需求存在巨大偏差。文档与管理类(36.2%)和知识检索类(28.9%)任务占据了实际使用的近三分之二,而诊断类任务仅占 3.7%,且超过三分之一的查询因信息缺失无法被良好回答。这一分布表明,依赖考试题或精选案例构建的基准无法预测模型在真实部署中的表现。
研究团队利用 RCQ-Map 框架对查询进行特征化,并将其与来自主要评测套件和前沿模型报告的 58 个公共基准进行了对比。结果显示,中位数基准不包含任何文档请求任务,且仅与实际使用场景共享 31% 的任务组合,这一比例甚至低于按任务类别均匀分布的预期。即便是那些设计初衷旨在模拟临床实践的评测套件,其单个基准与实际使用的相似度也未见提升。这意味着现有的 SOTA 分数在很大程度上反映的是模型在特定测试集上的能力,而非其在复杂、非结构化真实环境中的效能。
事实层面确认了医疗 AI 的实际负载结构与评测标准的不匹配;推断层面指出,若继续沿用现有基准作为准入或采购依据,可能导致对模型临床适用性的误判;猜测层面认为,未来行业可能需要建立基于真实工作流数据的动态评估体系,而非静态的通用基准。这种错位不仅影响产品选型,更可能掩盖模型在处理模糊指令时的潜在风险。
来源:arXiv cs.CL · arxiv.org