大语言模型并不具备真正的推理能力
文章指出当前大语言模型仅依赖概率预测与模式匹配,缺乏像 AlphaGo 那样显式的搜索机制与可追溯的推理状态。这种缺陷导致模型无法在医疗、工程等高风险领域提供可信结果,且常出现事后编造推理过程的现象。作者呼吁借鉴 AlphaGo 架构,构建具备独立信念系统与明确认知状态的新一代机器推理系统。
文章指出当前大语言模型仅依赖概率预测与模式匹配,缺乏像 AlphaGo 那样显式的搜索机制与可追溯的推理状态。这种缺陷导致模型无法在医疗、工程等高风险领域提供可信结果,且常出现事后编造推理过程的现象。作者呼吁借鉴 AlphaGo 架构,构建具备独立信念系统与明确认知状态的新一代机器推理系统。
VeriHarness 在固定基础模型、测试时没有参考答案或评分标准的条件下,把生成器使用的 LLM 转成带工作区、证据工具和可复用验证技能的智能体验证器,用于长程任务输出的选择与修订。论文在五个长程工作区基准和两个前沿模型上测试,称其选择得分高于已评估基线;加入证据支持的修订后,相比单次 rollout,Gemini 3.5 Flash 平均提升 6.2 分,Claude Opus 4.8 平均提升 6.4 分。 方法上的关键判断是:多次采样产生的分歧常能暴露正确替代项,而共识可能掩盖错误。因此系统不是简单投票,而是设置两个角色:disagreement resolver 用环境证据检查竞争声明,consensus challenger 测试共同声明并寻找遗漏要求;验证结果再指导最终产物的选择和修订。论文还称验证技能可以从失败反馈中自我改进,并公开约 26,000 条跨五个基准、两个模型的 rollout,称生成成本超过 $100,000。 事实是论文报告了选择得分、修订增益、模型名称、基准数量和公开数据规模。推断是这套设计把验证从静态评分转向可调用证据的工作流,可能更适合长程任务的错误定位。猜测是其收益是否能在更多模型、任务和真实生产环境中保持,仍需看外部复现。
一项提交给 Journal of Service Research 的预印本研究提出,生成式 AI 个性化的关键不是给模型更多上下文,而是找到当前交互所需的最小相关上下文集合。作者把用户历史行为和偏好称为 customer evidence,把服务方在生成时补充的情境信息称为 provider-side context,并认为后者一旦变得容易供给,数量增加不一定带来收益。 研究构建了 context sufficiency 理论,将上下文状态分为 insufficiency、sufficiency、saturation 和 interference,并提出 Context-Sufficiency Frontier 用于定位最小相关集合。作者在一大家居零售商的生成式推荐系统上做了 full-factorial experiment,结果显示相关上下文提升了推荐适配度,无关上下文则降低适配度并扰乱检索。 该工作把个性化问题从“补充更多上下文”转向“判断当前交互真正需要什么上下文,并在服务流程中施加约束”。对做推荐、客服或导购类 Agent 的团队而言,它提示上下文工程需要引入相关性筛选和约束机制,而不是简单扩大 prompt 或 RAG 输入。
推荐理由:它提出上下文充分性边界,提醒个性化系统优先筛掉无关上下文,而不是继续堆料。
这篇 arXiv 论文研究在同一批问题以两种互不兼容但都正确的约定书写时,训练数据排列会向模型参数写入什么。作者提出学习率调度不是背景条件,而是平均算子,并证明排列与调度在顺序效应中以分离乘积形式进入:排列只作为块周期出现,调度只决定端点能对训练中某一时刻赋予多大权重。 实验固定语料、预算和其他条件,只改变十种排列路径,并在不同 lr_scheduler_type 下各跑两次。常数学习率下,十种排列在分配上跨越 0.2221,对比下限达 11.63,且随排列更块状而单调变化;在单一 cosine 调度下,同样十种排列只落入两个可区分状态。论文测得 12.29σ 的排列切换,但在约定无关评分下恰好为零:十二个臂的 acc_A+acc_B 在 9.7% 内保持恒定,而分配份额从 0.04 到 0.87 变化;在提示中标明约定后,切换消失并达到 union ceiling 的 87.5%。 事实是论文给出了排列效应的机制分解与受控测量。推断是这类效应解释的是模型选择承诺哪一套约定,而不是总体能力高低。猜测是仅用 exact-match 或总分基准评估预训练数据顺序,可能系统性漏掉这种承诺偏移。
推荐理由:它把数据顺序影响从能力差异改写为约定承诺差异,提醒训练顺序评估不能只看总分基准。
这篇论文研究当知情对手与受众共享受限信号通道时,最能保护真实答案的信号策略。作者在 108 个确认性条目上发现,对抗鲁棒最优信号与先前工作提出的显著性极点完全一致;在 200,000 个条目池中,两者只在 2,748 个条目上不同,而这些条目恰好是先前显著性到贝叶斯坐标未定义的位置。 作者将对手引入一个强制选择任务,该任务抽象自 Deception: Murder in Hong Kong。对手知道目标、观察信号,并使用说服预算 beta 为最强错误答案辩护。随着 beta 增大,最优信号从最大化后验的选项转向最大化边界的选项;当 beta = 0 时,游戏复现原始 oracle 模型,且监听者温度为 tau = 1。论文称 18.2% 的条目在有限预算下最优选项会移动,并且每个条目都有精确的临界预算。 这种重合对经验评测形成结构性限制。两种对手框架使七个语言模型在 108 个条目中的 30 到 77 个条目上改变选择,但没有任何测量能判断这种移动是朝向对抗感知最优,还是朝向显著性,因为两个选项相同。论文将这一点定义为结构性限制而非空结果,并建议在评估对抗感知前先验证鲁棒目标是否与启发式目标重合。
推荐理由:它提醒评测者先检查对抗最优目标是否与启发式目标重合,否则无法区分模型是在对抗感知还是显著性偏置。
这篇 arXiv 论文测试现成小语言模型能否在 Agent harness 中承担围绕主 LLM 规划器的微任务,例如自动批准 shell 命令、写入记忆、选择工具和排序历史轮次。作者构建了 4 个固定提示、自动指标和预设阈值的基准,阈值锚定廉价非 LLM baseline,并要求配置的置信区间下界超过阈值才算合格。 在不调参、仅用 FP16、greedy 和单一冻结提示的条件下,Qwen3 0.6B、1.7B、4B、8B 的 16 个任务与模型组合全部未通过,作者通过检查原始输出和 parser 行为确认结果。logprob 决策阈值诊断把失败分为能力不足和可通过改变解码阈值修复两类;4-bit 量化(RTN/GPTQ/AWQ)造成的损害取决于模型规模,但没有让任何配置达到资格,且结果在 Llama-3.x 上复现,12 个配置均不合格,对阈值扫描和提示改写也稳健。 事实层面,论文给出的核心结论是现成 SLM 不能直接通过这类微任务的严格资格门槛。推断层面,作者建议把 SLM 放在已满足阈值要求的 baseline 之后,只在 baseline 失败时调用;例如 4B 模型对 BM25 短列表重排序可提升 0.047,但它本身仍未通过资格认证。猜测层面,这意味着 Agent 系统若追求低延迟或低成本,不应把关键微任务直接交给未校准的小模型,而应设计 baseline、阈值或级联机制来兜底。
推荐理由:它用置信区间门槛证明现成小模型在 Agent 微任务上普遍不合格,提醒不要把 SLM 直接替换关键路由层。
Xinyuan Song 和 Zekun Cai 在 arXiv 论文中指出,长程语言 Agent 的外部记忆使用会向少数核心状态集中,罕见状态则落入长尾并累积预测误差;他们据此提出 Core--Tail World Model(CTWM),用单一指数 τ 分配提示词预算并保留摘要化长尾。 在 Synthetic Graph World 上,论文称 CTWM 相对 graph-memory baseline 保持完整状态与转移覆盖,减少 5.9% prompt tokens,并把下半部分长尾预测误差降低 13.6%。同一配对比较还显示其在 ALFWorld 上有一致的 token 节省,在 LongMemEval 上减少 24.48% tokens 且总体准确率持平。审计部分还发现集中现象可复现但依赖策略:random-walk agent 产生与 log-normal 兼容的检索痕迹,语义 LLM 策略产生更强的截断幂律核心—长尾痕迹。 事实是论文给出了审计方法和三组基准上的配对结果;推断是重尾记忆轨迹可作为 token 高效世界模型的控制信号;猜测是其是否适用于更复杂真实任务仍取决于外部验证。
推荐理由:把长程 Agent 记忆从成功率和 token 成本转向长尾预测误差,可作为记忆系统评测与预算控制的新变量。
MIT 学者 Alex Zhang 在 Latent Space 播客中深入探讨 RLMs(递归语言模型)、GPU Mode 及多智能体蜂群研究。他解析了基于 RLMs 的框架如何率先解决 ARC-AGI-3,并对比 OpenAI 万级智能体实验与 Kimi 的多智能体路径。文章还涉及 GEV 架构、Prime Agent 机制及 AI 生成 GPU 内核等前沿话题。