arXiv cs.CL· Dianqiao Lei, Kevin Qinghong Lin, Pan Lu, Philip Torr, James Zou·· 4 小时前AI 评分75
论文发现大语言模型在禁止思考时仍保留推理惯性且随开放答案空间增强
Thinking Inertia: LLMs Keep Thinking When Told Not To
AI 摘要
该研究通过系统评估指出,大语言模型(LLMs)的“无思考”行为并非简单的指令关闭,而是存在显著的“思考惯性”,即显式推理痕迹在严格禁止下依然持续存在。作者提出了一套包含空思考率、指令感知问题-回答前相关性以及LLM-as-judge显式推理率的三维评估体系,用于区分纯答案输出、相关但非推断性文本与显式推理,从而纠正了以往仅依赖禁用模式或长文本轨迹作为代理指标的不可靠性。
实验覆盖六个大模型及布尔、多选和开放式三类任务,结果显示显式无思考控制无法可靠消除可见推理,且随着答案空间的开放,这种惯性反而更普遍。在准确率方面,布尔和多选题保持稳定,而开放式任务则揭示了纯答案合规性与任务准确率之间的权衡;重写相同问题并供给候选答案可使纯答案响应更容易生成。这些发现表明停止显式推理不能仅凭模型设置或指令假设完成,必须将其作为非平凡能力进行系统性评估。
事实层面,研究证实了特定指标下的推理残留现象及不同任务类型的表现差异;推断层面,这意味着当前以“关闭思考模式”为卖点的安全或效率优化可能失效,需重新设计对齐策略;猜测层面,若行业继续依赖现有指令关闭推理,可能在高风险场景面临不可控的中间过程泄露风险,但这需要更多工程实践验证。
来源:arXiv cs.CL · arxiv.org