跳到正文
原文
Simon Willison·· 20 小时前AI 评分52

Qwen3.8-27B 在禁用推理模式下无法准确执行多位数加法

Qwen3.8 27B addition in words

AI 摘要

Simon Willison 在本地 DGX Spark 硬件上对 Qwen3.8-27B-Q4_K_M.gguf 进行了加法测试,要求模型将结果以英文单词形式输出。在禁用推理(reasoning-disabled)的情况下,该模型在 5,070 个样本中仅达到 23.57% 的数值准确率,且随着操作数位数增加,准确率从 1-3 位的 97.04% 断崖式下跌至 10-13 位的 6.44%,尽管格式合规率高达 96.17%。

当启用推理后,模型在 169 个配对样本中取得了 167 次正确回答,并在部分长数字计算中展示了类似手算的对齐与进位过程(如“Wait, let me redo this more carefully”)。这一对比表明,Qwen3.8-27B 并非具备内建的数学引擎,而是必须通过生成推理文本(Chain of Thought)来辅助完成精确计算。

事实层面,该模型在纯概率预测下不具备可靠的算术能力;推断层面,这意味着在端侧部署此类模型进行复杂逻辑任务时,若未开启推理模式或上下文窗口不足以容纳思维链,将导致严重的功能缺失。猜测层面,这种对推理机制的强依赖可能限制了其在低算力环境下的实时响应能力,因为开启推理会显著增加延迟。

来源:Simon Willison · simonwillison.net