arXiv cs.CL· Shuai Guo, Yidong Cui·· 5 小时前AI 评分65
BeliefScope 提出区分大语言模型基于证据修正与受压力诱导偏移的诊断框架
BeliefScope: Diagnosing Evidence-Driven Revision and Pressure-Induced Shifts in Large Language Models
AI 摘要
该研究提出 BeliefScope 框架,旨在解决仅凭响应变化无法区分大语言模型是受真实相关证据驱动还是受无事实依据的用户方向性压力驱动的问题。作者通过控制黑盒实验设计,在固定命题周围交叉验证证据与压力因素,利用概率报告、分类判断和行动推荐等多尺度指标测量响应变化,并建立条件信念 - 响应曲线以明确诊断的有效性边界。
研究在包含 Qwen 和 Llama 共 36 个家族的模型族上进行了广泛评估,并针对 Gemma3-12B 等模型进行了补充检查。结果显示评估结果高度依赖上下文:在匹配的控制、解码策略或响应接口下,广泛的模型级差异可能发生变化,而某些模型内部的窄模式则保持稳定。指令干预进一步表明,减少目标对齐的压力跟随可能反映稳定的抵抗力,也可能意味着向相反方向的移动。
该工作的核心贡献在于建立了可分离证据效应与压力效应的观测设计标准,并通过合成条件和半合成压力测试映射了恢复能力随噪声增加的变化情况。这为行业提供了新的评估工具,用于更精准地识别模型幻觉来源及对齐机制,但需注意其结论严格限定于特定评估条件下的诊断有效性,而非通用行为预测。
来源:arXiv cs.CL · arxiv.org