跳到正文

#推理

今日 21 条
今天10月2日周五
  1. Reddit · MachineLearning68

    FLEET 用奖励记忆和 MCTS 调整 logits,减少 Best-of-N 盲采样

    FLEET 的作者提出,在奖励最大化任务中给搜索加入记忆,而不是只依赖重复采样。该算法先把外部奖励归因到具体 token,再用修改版 MCTS 在下一轮生成时调整 logits,使模型能利用此前获得的奖励信息。 方法上,FLEET 追踪高熵和高 varentropy 的 logits,把这些不确定状态视为分支点;对应的归一化 hidden states 存入向量库,并与奖励历史、节点转移等元数据关联。检索和更新基于余弦相似度,因为高相似状态下 KL divergence 足够低,可保留多数有意义 token。它不直接选择 token,而是对 top-k token 和探索集合排序,并惩罚次优 token,再交给解码策略。作者称在 GSM8K 和 LiveCodeBench v6 easy split 上用 Llama 3.2 3B 测试:GSM8K 只多解出 7 道题,但用一半迭代达到采样基线;LiveCodeBench 在相同预算下把分数从 0.59 提到 0.69,并用 9 次迭代达到基线,而基线需要 32 次。 事实是作者给出了方法、代码、预印本和两项基准结果。推断是这类记忆化搜索可能把 Best-of-N 从盲搜索推向可复用经验,但材料未提供更大模型或更多任务上的验证;其跨任务复用、作为 SFT/RL 先验的价值仍属作者设想,需要更多实验确认。

  2. MIT Technology Review · AI43

    大语言模型并不具备真正的推理能力

    文章指出当前大语言模型仅依赖概率预测与模式匹配,缺乏像 AlphaGo 那样显式的搜索机制与可追溯的推理状态。这种缺陷导致模型无法在医疗、工程等高风险领域提供可信结果,且常出现事后编造推理过程的现象。作者呼吁借鉴 AlphaGo 架构,构建具备独立信念系统与明确认知状态的新一代机器推理系统。

  3. arXiv cs.CR68

    ReCast 用合同保持的改写框架保护固定接口多模态推理中的源内容

    ReCast 是一个 agentic plug-in 框架,用于在调用远程多模态模型时保护私有输入。它不是简单做文本脱敏或身份匿名化,而是保留任务相关关系和所需输入模态,替换源特定内容,从而在图表、语音等固定媒体接口下降低敏感内容暴露。 具体机制上,ReCast 先在本地把输入转换成共享的文本 evidence-query record,再用一个蒸馏出的 4B 模型联合改写实体和主题,并通过本地可逆、角色感知的数值映射替换数值。随后由重建 agent 从受保护记录生成并验证所需媒体。远程 solver 返回程序后,受保护操作数会在本地执行前恢复。论文在 4,000 个 ChartQA 和 NMSQA 留出样本上报告了结果:ReCast 达到 75.10% 准确率,保留了未保护远程准确率的 92.43%;基于模型的审计标记出 7.95% 的 solver-bound 请求存在源内容泄漏。 这篇工作的关键增量在于,它把隐私保护问题从“隐藏身份”重新定义为“保持任务合同但替换源内容”。事实是论文给出了准确率、保留率和泄漏率三项指标;推断是这种方法更适合必须向远程多模态服务提交图表或语音、但又不能直接暴露原始内容的场景;猜测是其实际部署价值取决于审计模型对泄漏的识别能力是否足够可靠。

    推荐理由:它把隐私保护从“匿名化”推进到“合同保持的可重写接口”,可改变多模态外包推理的安全设计判断。

  4. arXiv cs.CR72

    SafeDepth 提出安全感知的 token 级自适应计算框架以降低有害响应

    SafeDepth 是面向 Llama-3-8B-Instruct 的轻量插件框架,通过 router 和 adapter 选择性执行 Transformer 层,在减少计算的同时降低有害响应率。论文报告其相对 full-depth inference 减少计算并大体保持任务性能;与 FlexiDepth 相比,在五个 harmful-request benchmarks 上 unsafe-response rates 均下降,HarmBench-HJ 从 55.44% 降至 25.25%,XSTest false-refusal rate 从 12.0% 降至 4.0%。事实是跳层选择会改变安全表现,推断是 token 级自适应推理不能只按算力优化,猜测是这类方法可能成为推理成本与安全响应之间的工程折中。

  5. arXiv cs.CR68

    论文比较冻结 LLM 在层级网络防御中从规划到执行的控制效果

    这篇 arXiv 论文研究冻结、零样本的大语言模型能否在层级网络防御中提供免重训练控制,并比较 LLM 只负责规划与同时负责执行时的差异。作者将防御任务拆成 planner-executor 层级:planner 在固定时间范围内选择要防守的子网,executor 在该子网内选择具体防御动作。实验在 Cyberwheel 环境中进行,该环境内置映射到 MITRE ATT&CK 框架的自动红队 agent,并比较 RL+RL、LLM+RL 和 LLM+LLM 三种配置,覆盖 3B 到 70B 参数的六个模型,包括两个网络安全专用模型,以及小型、中型和大型网络。 结果显示,仅把 planner 替换为 LLM 时,随着网络规模扩大收益有限;把 LLM 控制扩展到 execution 后,能力足够强的模型才出现明显改善。论文给出的例子是,一个冻结的通用 70B 模型在三种网络规模下使用相同权重,能把成功横向移动控制在约 1% 的步数,攻击者影响接近零,而 RL 基线需要为每个网络规模重新训练。论文据此认为,足够强的冻结 LLM 可以在所评估网络规模上维持防御性能,且强战术执行对释放 LLM 控制收益很关键。 事实是论文报告了不同配置下的防御指标和免重训练能力;推断是 LLM 的价值不只来自高层任务分解,还依赖底层动作选择能力;猜测是这类方法能否迁移到真实企业网络,仍取决于环境保真度、攻击分布和运维约束。

    推荐理由:论文把 LLM 用于网络防御的增益拆到规划与执行两层,能校正“只接高层规划就够”的 Agent 部署判断。

  6. arXiv cs.AI68

    ActiveSaddler 将自动化课程学习引入 LLM Agent harness 优化

    ActiveSaddler 提出一种自动化课程学习方法,用于优化 LLM agent 的 harness,即提示词、工具接口与控制逻辑的组合。该方法不再固定使用预设训练场景,而是把课程建模为非平稳多臂老虎机问题,动态调整哪些失败模式应被优先优化。 系统将反复出现的执行失败抽象为可复用的 failure-pattern arms,估计针对每个模式继续优化可能带来的学习进展,并在修复已知弱点与探索未见场景之间做平衡。在 GAIA2 和 Terminal-Bench 2.0 上,相比使用固定场景顺序的同一 harness 优化器,ActiveSaddler 分别提升测试 Pass@1 4.4 和 7.5 个百分点。 事实是论文给出了两个基准上的量化增益与消融结果;推断是这种收益来自对优化目标集合和优先级的持续更新;猜测是这类课程共演机制可能更适合长周期、多轮迭代的 agent 工程流程。

    推荐理由:它把 agent harness 优化从固定场景迭代推进到自适应课程学习,可改变对训练场景选择策略的工程判断。

  7. arXiv cs.AI72

    ReLiveGym 通过数周重放真实世界信息流评测长时程智能体,发现行动时机机制影响性能

    论文提出 ReLiveGym,让大语言模型智能体在按时间重放的数周新闻、市场与社交媒体流中稀疏行动,以评测长时程任务。跨八个基础语言模型测试显示,智能体如何决定何时行动是重要的运行框架设计轴,最优设计会随任务和模型选择变化,持续从事后反馈中学习也影响性能并缓解失败模式。事实是这些结果来自预印本;推断是长时程智能体产品应把触发时机与反馈闭环纳入设计;材料未提供商业数据,故不猜测收益。

  8. arXiv cs.AI48

    JusticeAxis 如何评估法律判决在规则应用与自由裁量间的平衡

    JusticeAxis 将法律判决形式化为参考锚定任务,引入包含 256 起真实刑事案件的基准及 JusticeAgent 智能体框架。实验显示模型规模变化导致失败方向改变:开源骨干模型转向无依据理由,前沿模型则回归法定默认值。该框架验证了冻结开源骨干模型作为插件可达商业水平。

  9. arXiv cs.AI46

    ContractRL:基于合约约束的组相对策略优化实现可审计工具调用修复

    ContractRL 提出一种受合约约束的顺序修复协议,将验证器引导的 JSON 修复建模为有界决策过程。在相同验证信息下,该模型以 34.4 个 token 达到 0.9362 语义成功率,优于 Patch-SFT(0.9076)和全量再生(0.9148)。策略优化后语义成功率进一步提升至 0.9375,且与 Patch-SFT 相比差异显著。

  10. arXiv cs.AI78

    论文测量现成 SLM 在 Agent 微任务上的资格缺口:16 个 Qwen3 配置均未达阈值

    这篇 arXiv 论文测试现成小语言模型能否在 Agent harness 中承担围绕主 LLM 规划器的微任务,例如自动批准 shell 命令、写入记忆、选择工具和排序历史轮次。作者构建了 4 个固定提示、自动指标和预设阈值的基准,阈值锚定廉价非 LLM baseline,并要求配置的置信区间下界超过阈值才算合格。 在不调参、仅用 FP16、greedy 和单一冻结提示的条件下,Qwen3 0.6B、1.7B、4B、8B 的 16 个任务与模型组合全部未通过,作者通过检查原始输出和 parser 行为确认结果。logprob 决策阈值诊断把失败分为能力不足和可通过改变解码阈值修复两类;4-bit 量化(RTN/GPTQ/AWQ)造成的损害取决于模型规模,但没有让任何配置达到资格,且结果在 Llama-3.x 上复现,12 个配置均不合格,对阈值扫描和提示改写也稳健。 事实层面,论文给出的核心结论是现成 SLM 不能直接通过这类微任务的严格资格门槛。推断层面,作者建议把 SLM 放在已满足阈值要求的 baseline 之后,只在 baseline 失败时调用;例如 4B 模型对 BM25 短列表重排序可提升 0.047,但它本身仍未通过资格认证。猜测层面,这意味着 Agent 系统若追求低延迟或低成本,不应把关键微任务直接交给未校准的小模型,而应设计 baseline、阈值或级联机制来兜底。

    推荐理由:它用置信区间门槛证明现成小模型在 Agent 微任务上普遍不合格,提醒不要把 SLM 直接替换关键路由层。

  11. arXiv cs.AI78

    论文发现角色分工 QA 中推理链主要改变验证判断而非答案准确率

    这篇论文研究在角色分工 QA 流程中,reasoner 向 verifier 传递的 rationale 究竟提供了什么。作者在固定证据和候选答案的前提下,只改变跨边界传递的 rationale,并在 400 条 MuSiQue、HotpotQA 和 2WikiMultiHopQA 样本上用 DeepSeek 同时作为生成器和验证器进行测试。 结果显示,忠实 rationale 相比不传 rationale 对答案准确率几乎没有提升;但被破坏的 rationale 会显著改变 verifier 对支持关系的判断。盲验证提示下,无害改写只让支持判断偏移 0–2.5%,破坏性 rationale 则偏移 10–22%;显式 rationale-checking 提示会把同一模式放大到 34–55%。最终答案变化较小,为 2–30%,且只有 2.9–35.3% 的被破坏支持翻转同时伴随答案变化。人工审计进一步显示,42 个有效破坏样本中有 16 个属于 corruption-overtrust,而模型接受的 10 条被破坏 rationale 中有 9 条被人工拒绝或标记为不清楚。 该研究给出的事实是,rationale 共享不应只被评估为提高答案准确率的通道,更应被当作验证消息机制来评估。由此可以推断,多智能体 QA 或 Agent 流水线如果直接透传推理链,可能引入新的失败面:验证器会被表面连贯但实质损坏的解释牵引,而不是独立复核证据。论文中的跨模型与任务边界检查还表明,这一通道何时被放大、何时失效,取决于具体提示和任务结构。

    推荐理由:它把 rationale 传递从“提升答案”重新界定为“验证消息干预”,可改变多智能体 QA 中是否该透传推理链的设计判断。

  12. Hacker News · AI68

    Stratego 超人类 AI 研究展示训练成本只需数千美元

    这篇 arXiv 论文报告 Stratego 不完全信息博弈中的超人类 AI 结果,称达到顶级人类水平并实现远超人类的表现只需数千美元训练成本。摘要给出的事实是,此前数百万美元训练仍未达到顶级人类水平,本文通过 self-play reinforcement learning 和 test-time search 的通用方法实现性能与成本上的显著变化。可推断其降低不完全信息博弈研究门槛,但材料未给出具体模型、基准、对手或代码,不能据此判断产品化或通用能力。

  13. Hacker News · AI78

    Quail 如何用 roofline 模型估算 AI-SQL 过滤器的延迟成本

    Quail 团队提出用 roofline 模型估算 AI-SQL 过滤器延迟,而不是为每个模型、GPU 或工作负载重新 profiling。在 H100 和 Qwen3-4B-fp8 上,5,000 条 IMDB 评论的单过滤器 SoL 下界为 6.64 秒,三过滤器最优顺序 F2→F1→F3 的 SoL 下界为 6.86 秒。这个模型把 LLM 查询计划从经验 profiling 变成可计算的硬件下界,核心不是 token 数,而是 FLOPs、HBM 流量、KV 复用和 filter 选择率。 成本模型把每个 filter 拆成 projection、attention 和 MLP,分别计算 FLOPs 与 HBM 流量,再取 max(FLOPs/峰值算力, bytes/HBM 带宽)。单过滤器 5,000 条评论需要 16 次 forward pass,projection 1.6778 秒、attention 0.1850 秒、MLP 4.7818 秒,全部 compute-bound。多过滤器时,共享 prefix 的 KV cache 可复用,HBM 容量把 batch 限制到约 1,200 条文档;排序规则用 ask cost/(1-selectivity) 给后续 filter 排名,并尝试每个 filter 作为第一个,例子中 F2 先执行比 F1 先执行低约 4.7%。 事实是 SoL 是硬件峰值下的下界,实际运行可能更长,因为峰值算力和跨 filter overlap 不一定达到。推断是 LLM 查询引擎的查询计划器必须把模型结构、量化格式、KV 复用和 filter selectivity 纳入成本,而不是只看 prompt token 数;GQA、FP8 权重和较小 KV footprint 会直接影响可批处理文档数。猜测是如果后续扩展到 AI JOIN、AI CLASSIFY 和 Blackwell FP4,硬件感知成本模型会成为 AI-SQL 产品差异化的关键。

    推荐理由:它把 AI-SQL 过滤器的延迟估计从逐模型 profiling 转为 roofline 下界,并给出 filter ordering 与 KV 复用成本模型,能校正 LLM 查询引擎优化方向。