arXiv cs.AI· Xiaoyang Wang, Tianrui Wang, Christopher C. Yang·· 3 小时前AI 评分75
医学大模型共识可能全员错误,新框架通过过程特征实现认证拒答
Unanimously Wrong: Certified Abstention from How Medical LLM Consensus Forms
AI 摘要
该论文指出在临床问答系统中,独立专家的一致意见常被误认为可靠性证据,但系统可能在所有采样中返回相同错误答案,此时基于最终状态的共识信号完全失效。作者提出ProbeGuard框架,不再依赖投票结果的一致性,而是通过分析共识形成过程来触发认证拒答,包括追踪一致轨迹、少数派持久性、检索饱和度和理由语义熵等过程特征。
在MedQA基准测试中,13.4%的全票赞成回答实际上是错误的,传统共识信号无法识别这些情况。引入过程信号后,正确与错误共识的区分度(AUROC)从随机水平提升至0.696。该框架采用分层学习-测试校准策略,将上述分数转化为无分布假设的选择风险上界,在观察到的选择风险为9.0%时能回答六成全票层问题,随着域内校准数据积累可覆盖九成问题。
事实层面,论文验证了共识作为正确性代理指标的脆弱性,并展示了Process signals的具体提升效果;推断层面,这表明当前多轮Agent医疗系统的信任机制存在系统性盲区,仅靠最终一致性无法保障安全;猜测层面,若行业广泛采用此类过程监控,可能会推动Agent架构从单纯追求输出一致转向关注推理路径的可解释性与鲁棒性,但这需要更多跨领域基准的验证。
来源:arXiv cs.AI · arxiv.org