研究:增加推理预算未降低大模型认知偏差
先了解这件事
2026年10月8日,一项发表于arXiv cs.CL的研究对四个模型家族进行了剂量反应实验。该研究通过12,350次API调用,设定了从0到8,192 tokens的思考上限,考察锚定、框架效应等六种经典偏见。结果显示,随着实际消耗的推理token增加,偏见幅度并未显著下降,部分指标甚至偏离人类方向更远。点估计显示,推理模型并不比非推理兄弟模型更少受认知偏见影响,且部分偏差反而加剧。其中,锚定效应是唯一符合人类直觉方向的偏见(d = 1.89)。
AI 根据报道生成 · 3 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv cs.CL大模型在推理预算升级时并未减少认知偏见且部分偏差反而加剧
该研究通过 12,350 次 API 调用对四个模型家族进行了剂量反应实验,发现推理模型并不比其非推理兄弟模型更少受认知偏见影响,点估计甚至显示偏见略高。实验覆盖了锚定、框架效应、损失厌恶等六种经典偏见,并设定了从 0 到 8,192 tokens 的思考上限,结果显示随着实际消耗的推理 token 增加,偏见幅度并未显著下降,部分指标甚至偏离人类方向更远。 具体数据显示,锚定效应是唯一符合人类直觉方向的偏见(d = 1.89),而其余五种偏见在七个模型中均呈现相反倾向。其中框架效应的反转具有统计可靠性,承诺升级、确认偏误和损失厌恶则呈现方向性反转,可得性启发式偏见则未出现。值得注意的是,仅用一行指令要求重述锚点即可降低所有五项锚定任务中的偏见,但单纯增加思考 token 数量对此无效,尽管该效果未达到统计显著性(p = .057)。 事实层面表明测试时的推理过程不能保证理性输出,推断层面意味着当前将长思考视为“理性保障”的工程策略存在根本缺陷,猜测层面是未来部署需针对特定偏见类型设计干预机制而非通用延长推理。产业链推论指向模型评估标准需从单一准确率转向多维偏见审计,产品端若继续依赖增加计算量来优化决策质量可能面临边际效益递减甚至负向反馈的风险。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。