跳到正文
原文
arXiv cs.CL· Zizhuo Zhang, Xiong Peng, Jingwei Sun, Rong Yao, Borui Jiang, Bo Han·· 6 小时前AI 评分68

PFaithBench 评估显示大语言模型在上下文不足时存在强烈的过度回答偏差

Rethinking Faithfulness in LLMs: A Pairwise Context-Sensitive Perspective

AI 摘要

该研究提出 Pairwise Faithfulness Benchmark (PFaithBench),通过对比同一问题在支持性与非支持性上下文下的模型表现,重新定义大语言模型的忠实度评估标准。针对现有孤立评估无法捕捉模型适应上下文变化能力的缺陷,该基准测试了 39 个来自 7 个模型家族的模型,发现当前主流模型普遍存在向“回答问题”倾斜的强偏差,绝大多数忠实度错误源于过度回答(over-answering),即模型在缺乏足够证据时仍编造答案。

实证数据显示,忠实度训练高度敏感于问答与拒答数据的构成来源。若从不匹配的数据源构建这两类样本,模型会依赖数据集特定的捷径而非真正的上下文充分性判断。增加监督回答的数据虽能提升回答性能,但会加剧过度回答现象;而增加拒答数据虽能减少幻觉,却会导致过度拒答(over-abstention)。这一发现表明,单纯调整数据比例难以平衡两者,需更精细的数据构造策略。

事实层面,PFaithBench 已开源代码与数据,覆盖 39 个模型。推断上,这意味着现有的微调策略可能因忽视上下文切换能力而失效,导致模型在实际应用中产生隐蔽的幻觉。猜测上,未来对齐技术可能需要引入显式的上下文切换奖励机制,而非仅优化单一维度的准确率或拒答率。

来源:arXiv cs.CL · arxiv.org