跳到正文
热点事件持续更新

Qwen3.8-27B禁用推理模式多位数加法表现不佳

1 篇报道1 个报道来源19 小时前更新

先了解这件事

AI 综述

2026年10月5日,Simon Willison在本地DGX Spark硬件上对Qwen3.8-27B-Q4_K_M.gguf模型进行了加法测试。测试要求模型以英文单词形式输出结果。在禁用推理模式下,该模型在5,070个样本中数值准确率为23.57%。随着操作数位数增加,准确率从1-3位的97.04%断崖式下跌至10-13位的6.44%,尽管格式合规率高达96.17%。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. Simon Willison
    Qwen3.8-27B 在禁用推理模式下无法准确执行多位数加法

    Simon Willison 在本地 DGX Spark 硬件上对 Qwen3.8-27B-Q4_K_M.gguf 进行了加法测试,要求模型将结果以英文单词形式输出。在禁用推理(reasoning-disabled)的情况下,该模型在 5,070 个样本中仅达到 23.57% 的数值准确率,且随着操作数位数增加,准确率从 1-3 位的 97.04% 断崖式下跌至 10-13 位的 6.44%,尽管格式合规率高达 96.17%。 当启用推理后,模型在 169 个配对样本中取得了 167 次正确回答,并在部分长数字计算中展示了类似手算的对齐与进位过程(如“Wait, let me redo this more carefully”)。这一对比表明,Qwen3.8-27B 并非具备内建的数学引擎,而是必须通过生成推理文本(Chain of Thought)来辅助完成精确计算。 事实层面,该模型在纯概率预测下不具备可靠的算术能力;推断层面,这意味着在端侧部署此类模型进行复杂逻辑任务时,若未开启推理模式或上下文窗口不足以容纳思维链,将导致严重的功能缺失。猜测层面,这种对推理机制的强依赖可能限制了其在低算力环境下的实时响应能力,因为开启推理会显著增加延迟。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。