arXiv cs.CL· Jorma Valjakka, Juhani Kivim\"aki, Juha Myll\"ari, Jukka K. Nurminen·· 5 小时前AI 评分60
NeurIPS 2026 论文指出幻觉检测基准存在参考忠实度与事实正确性的概念混淆
The Labeling Problem in Hallucination Detection Benchmarks: An Empirical Evaluation
AI 摘要
该研究通过 900 个人工标注问答对,实证评估了当前大模型幻觉检测基准的方法论缺陷,核心发现是自动化标签策略常在目标为“事实正确性”时错误应用了“参考忠实度”标准。实验覆盖了三个常用 QA 数据集和三个生成模型,对比了词汇相似度指标、基于 NLI 的参考蕴含基线以及七种不同提示变体的 LLM 裁判作为自动标签器。
数据表明,自动化标签策略之间以及与人工标注之间存在显著分歧,且多数策略表现出强烈的方向性误差偏差。关键证据在于,将针对忠实度的提示词替换为针对事实正确性的提示词后,大多数裁判 - 生成器组合与人工标注的一致性得到提升,同时虚假阳性(False Positive)的主导地位被削弱。这证明自动化幻觉标签的质量高度依赖于目标准则在提示中的明确定义,而非单纯依赖模型能力或算法选择。
推论认为,基准设计必须将标签源的选择视为基础环节,需显式声明、验证并与基准目标严格匹配。事实层面确认了现有开放域 QA 基准在区分“未引用信息”与“事实错误”时的机制失效;推断层面指出盲目使用现有自动化指标可能导致对模型安全能力的误判;猜测层面认为未来基准若未修正此概念混淆,其 SOTA 排名可能无法反映真实的抗幻觉能力。
来源:arXiv cs.CL · arxiv.org