跳到正文
原文
arXiv cs.CL· Aishik Nagar, Abhishek Vaidyanathan, Arun-Kumar Kaliya-Perumal, Elijah Tzen Hsuen Boey, Stefan Winkler·· 6 小时前AI 评分72

研究发现所有测试的开源大语言模型内部均存在可定位且因果驱动的临床概念中心

Clinical Concept Centers in LLMs

AI 摘要

该论文通过机制可解释性方法,在十一个开源大语言模型的潜在空间中发现了专门用于临床概念的“概念中心”。这些中心不仅可被定位和解释,且在受控与开放设置下能因果性地驱动模型行为,证明了模型内部表征比输出文本承载了更高保真度的信息。

实证细节显示,即使在对抗性的角色提示下,模型仍能保持内部一致性并调用相关概念中心;而对齐式提示则能进一步提升下游临床性能。研究团队模拟了真实部署场景,发现沿这些概念中心引导模型可带来实质性的性能提升,并通过盲测验证了概念中心的激活与使用模式能够预测临床医生的偏好。

这一发现将临床决策支持系统的评估从单纯的语言输出层面推进到了潜在空间机制层面。事实是模型内部存在可操控的概念回路;推断是未来可通过直接操作这些回路来增强模型在医疗场景中的可靠性与安全性;猜测是这种机制可能适用于其他专业领域的模型对齐与纠偏,但需进一步验证。

来源:arXiv cs.CL · arxiv.org