跳到正文

#推理

今日 25 条
今天10月2日周五
  1. Reddit · MachineLearning68

    FLEET 用奖励记忆和 MCTS 调整 logits,减少 Best-of-N 盲采样

    FLEET 的作者提出,在奖励最大化任务中给搜索加入记忆,而不是只依赖重复采样。该算法先把外部奖励归因到具体 token,再用修改版 MCTS 在下一轮生成时调整 logits,使模型能利用此前获得的奖励信息。 方法上,FLEET 追踪高熵和高 varentropy 的 logits,把这些不确定状态视为分支点;对应的归一化 hidden states 存入向量库,并与奖励历史、节点转移等元数据关联。检索和更新基于余弦相似度,因为高相似状态下 KL divergence 足够低,可保留多数有意义 token。它不直接选择 token,而是对 top-k token 和探索集合排序,并惩罚次优 token,再交给解码策略。作者称在 GSM8K 和 LiveCodeBench v6 easy split 上用 Llama 3.2 3B 测试:GSM8K 只多解出 7 道题,但用一半迭代达到采样基线;LiveCodeBench 在相同预算下把分数从 0.59 提到 0.69,并用 9 次迭代达到基线,而基线需要 32 次。 事实是作者给出了方法、代码、预印本和两项基准结果。推断是这类记忆化搜索可能把 Best-of-N 从盲搜索推向可复用经验,但材料未提供更大模型或更多任务上的验证;其跨任务复用、作为 SFT/RL 先验的价值仍属作者设想,需要更多实验确认。

  2. arXiv cs.CR68

    ReCast 用合同保持的改写框架保护固定接口多模态推理中的源内容

    ReCast 是一个 agentic plug-in 框架,用于在调用远程多模态模型时保护私有输入。它不是简单做文本脱敏或身份匿名化,而是保留任务相关关系和所需输入模态,替换源特定内容,从而在图表、语音等固定媒体接口下降低敏感内容暴露。 具体机制上,ReCast 先在本地把输入转换成共享的文本 evidence-query record,再用一个蒸馏出的 4B 模型联合改写实体和主题,并通过本地可逆、角色感知的数值映射替换数值。随后由重建 agent 从受保护记录生成并验证所需媒体。远程 solver 返回程序后,受保护操作数会在本地执行前恢复。论文在 4,000 个 ChartQA 和 NMSQA 留出样本上报告了结果:ReCast 达到 75.10% 准确率,保留了未保护远程准确率的 92.43%;基于模型的审计标记出 7.95% 的 solver-bound 请求存在源内容泄漏。 这篇工作的关键增量在于,它把隐私保护问题从“隐藏身份”重新定义为“保持任务合同但替换源内容”。事实是论文给出了准确率、保留率和泄漏率三项指标;推断是这种方法更适合必须向远程多模态服务提交图表或语音、但又不能直接暴露原始内容的场景;猜测是其实际部署价值取决于审计模型对泄漏的识别能力是否足够可靠。

    推荐理由:它把隐私保护从“匿名化”推进到“合同保持的可重写接口”,可改变多模态外包推理的安全设计判断。

  3. arXiv cs.CR72

    SafeDepth 提出安全感知的 token 级自适应计算框架以降低有害响应

    SafeDepth 是面向 Llama-3-8B-Instruct 的轻量插件框架,通过 router 和 adapter 选择性执行 Transformer 层,在减少计算的同时降低有害响应率。论文报告其相对 full-depth inference 减少计算并大体保持任务性能;与 FlexiDepth 相比,在五个 harmful-request benchmarks 上 unsafe-response rates 均下降,HarmBench-HJ 从 55.44% 降至 25.25%,XSTest false-refusal rate 从 12.0% 降至 4.0%。事实是跳层选择会改变安全表现,推断是 token 级自适应推理不能只按算力优化,猜测是这类方法可能成为推理成本与安全响应之间的工程折中。

  4. arXiv cs.CR68

    论文比较冻结 LLM 在层级网络防御中从规划到执行的控制效果

    这篇 arXiv 论文研究冻结、零样本的大语言模型能否在层级网络防御中提供免重训练控制,并比较 LLM 只负责规划与同时负责执行时的差异。作者将防御任务拆成 planner-executor 层级:planner 在固定时间范围内选择要防守的子网,executor 在该子网内选择具体防御动作。实验在 Cyberwheel 环境中进行,该环境内置映射到 MITRE ATT&CK 框架的自动红队 agent,并比较 RL+RL、LLM+RL 和 LLM+LLM 三种配置,覆盖 3B 到 70B 参数的六个模型,包括两个网络安全专用模型,以及小型、中型和大型网络。 结果显示,仅把 planner 替换为 LLM 时,随着网络规模扩大收益有限;把 LLM 控制扩展到 execution 后,能力足够强的模型才出现明显改善。论文给出的例子是,一个冻结的通用 70B 模型在三种网络规模下使用相同权重,能把成功横向移动控制在约 1% 的步数,攻击者影响接近零,而 RL 基线需要为每个网络规模重新训练。论文据此认为,足够强的冻结 LLM 可以在所评估网络规模上维持防御性能,且强战术执行对释放 LLM 控制收益很关键。 事实是论文报告了不同配置下的防御指标和免重训练能力;推断是 LLM 的价值不只来自高层任务分解,还依赖底层动作选择能力;猜测是这类方法能否迁移到真实企业网络,仍取决于环境保真度、攻击分布和运维约束。

    推荐理由:论文把 LLM 用于网络防御的增益拆到规划与执行两层,能校正“只接高层规划就够”的 Agent 部署判断。

  5. arXiv cs.AI75

    研究发现模型与 Agent 框架的配对会逆转性能排名且成本不决定表现

    该论文评估了 66 种配置,包括四种可配置框架(OpenHands、DeepSeek Harness、PI、openJiuwen)与五个模型的组合,在 TUA-Bench、ALE-CLI 和 Terminal-Bench 4 上测试发现,模型排名随框架变化而反转。例如在 Terminal-Bench 4 上,Claude 在 OpenHands 中领先 GPT 7.94 分,但在 PI 中落后 30.16 分。对于五分之四的模型,最佳框架在不同基准间并不一致,但部分配对具有稳定性,如 openJiuwen 使 Kimi 在所有三个基准上得分最高,提升幅度为 5.61 至 11.11 分。 证据细节显示,厂商原生框架并非总是最优解,且更高成本不能保证更高分数。GPT 在 PI 框架下的得分高于 DeepSeek Harness,但任务成本不足四分之一。轨迹匹配分析表明,模型自身处理修复的能力是关键变量,框架将失败反馈给模型的形式决定了最终效果:GPT 适应 PI 的轻量级脚手架,而经常发出格式错误工具调用的 Kimi 则在 openJiuwen 中表现最佳。 事实层面,研究已发布所有 6,204 条评分轨迹、代码及适配器;推断层面,这意味着单纯比较模型能力或框架能力的指标可能误导选型,必须结合具体任务场景进行联合评估;猜测层面,未来可能出现针对特定模型优化的专用框架,而非通用型框架通吃市场。

  6. arXiv cs.AI68

    ActiveSaddler 将自动化课程学习引入 LLM Agent harness 优化

    ActiveSaddler 提出一种自动化课程学习方法,用于优化 LLM agent 的 harness,即提示词、工具接口与控制逻辑的组合。该方法不再固定使用预设训练场景,而是把课程建模为非平稳多臂老虎机问题,动态调整哪些失败模式应被优先优化。 系统将反复出现的执行失败抽象为可复用的 failure-pattern arms,估计针对每个模式继续优化可能带来的学习进展,并在修复已知弱点与探索未见场景之间做平衡。在 GAIA2 和 Terminal-Bench 2.0 上,相比使用固定场景顺序的同一 harness 优化器,ActiveSaddler 分别提升测试 Pass@1 4.4 和 7.5 个百分点。 事实是论文给出了两个基准上的量化增益与消融结果;推断是这种收益来自对优化目标集合和优先级的持续更新;猜测是这类课程共演机制可能更适合长周期、多轮迭代的 agent 工程流程。

    推荐理由:它把 agent harness 优化从固定场景迭代推进到自适应课程学习,可改变对训练场景选择策略的工程判断。

  7. arXiv cs.AI72

    ReLiveGym 通过数周重放真实世界信息流评测长时程智能体,发现行动时机机制影响性能

    论文提出 ReLiveGym,让大语言模型智能体在按时间重放的数周新闻、市场与社交媒体流中稀疏行动,以评测长时程任务。跨八个基础语言模型测试显示,智能体如何决定何时行动是重要的运行框架设计轴,最优设计会随任务和模型选择变化,持续从事后反馈中学习也影响性能并缓解失败模式。事实是这些结果来自预印本;推断是长时程智能体产品应把触发时机与反馈闭环纳入设计;材料未提供商业数据,故不猜测收益。

  8. arXiv cs.AI72

    Incident-Arena 发布:20个真实生产任务测试显示AI智能体故障修复成功率低于64.3%

    arXiv cs.AI 发布的 Incident-Arena 基准测试针对 AI 编码智能体在生产环境故障响应(agentic SRE)中的可靠性,包含20个基于真实开源软件构建的任务。该基准通过部署应用至临时 Kubernetes 集群、注入配置层及镜像层故障并施加持续负载,模拟真实生产场景,采用功能验证器而非静态检查来确保系统级指标稳定及修复安全性。 测试结果显示,跨3种应用底座的20个任务中,前沿模型得分均低于64.3%。失败原因涵盖诊断与定位错误、修复不完整以及引入不安全的回归。智能体平均消耗2.81M tokens并经历41轮交互,证明了长程推理需求远超现有基准设定。 事实层面,该研究证实当前模型在处理复杂生产故障时存在显著能力缺口;推断层面,这意味着将智能体直接应用于关键基础设施运维仍面临高风险,需解决长上下文下的稳定性问题;猜测层面,若无法突破此瓶颈,行业对“全自动运维”的商业化时间表可能需重新评估。

  9. arXiv cs.AI75

    新论文证实多用户多智能体团队在共享资源场景下表现普遍劣于单一协调者

    该研究通过五个前沿模型和 77 个场景,在 API 密钥、诊所日历、个人助理及合并队列四个共享资源环境中,对比了单一协调者与多用户多智能体团队的绩效。事实显示,无论是否具备通信通道,多智能体团队在所有环境中的群体产出均低于单一协调者;缺乏通道时两个环境完全崩溃,有通道时则因协调开销产生显著差距。例如在个人助理场景中,单一协调者完成目标请求的频率是团队的约两倍。 作者识别出导致性能下降的具体行为模式:随着团队规模扩大出现停滞(stalling)、相互覆盖操作以及捏造主张(fabricating claims)。尽管提出了团队负责人、明确程序指令及平台检查等缓解措施,但效果具有环境特异性。研究将发布包含 74 个场景的 MAMUBench 基准,用于评估多用户多智能体协调问题。 推断表明,当前架构下简单堆叠多个独立 Agent 无法解决复杂协作问题,反而可能引入不可控的负外部性。猜测认为,未来产品若需支持多用户协作,必须依赖强中心化的编排层或特定的协议约束,而非依赖 Agent 间的自发协商。此结论基于实验数据,属于可验证事实,而非行业推测。

  10. arXiv cs.AI48

    JusticeAxis 如何评估法律判决在规则应用与自由裁量间的平衡

    JusticeAxis 将法律判决形式化为参考锚定任务,引入包含 256 起真实刑事案件的基准及 JusticeAgent 智能体框架。实验显示模型规模变化导致失败方向改变:开源骨干模型转向无依据理由,前沿模型则回归法定默认值。该框架验证了冻结开源骨干模型作为插件可达商业水平。

  11. arXiv cs.AI46

    ContractRL:基于合约约束的组相对策略优化实现可审计工具调用修复

    ContractRL 提出一种受合约约束的顺序修复协议,将验证器引导的 JSON 修复建模为有界决策过程。在相同验证信息下,该模型以 34.4 个 token 达到 0.9362 语义成功率,优于 Patch-SFT(0.9076)和全量再生(0.9148)。策略优化后语义成功率进一步提升至 0.9375,且与 Patch-SFT 相比差异显著。

  12. arXiv cs.AI68

    Scientific Agents 论文显示专业系统提示词未提升准确率但显著增加成本与失败率

    该研究评估了503个职业特定系统提示词(Scientific Agents)在科学任务中的表现,发现使用匹配的职业简介并未带来一致的准确率提升,反而使输出token数增加1.5至2.3倍,单次成功调用的成本增加2.2至4.5倍。在9个文本科学基准测试的4,531个问题中,平均准确率差异为-0.6个百分点,且无任何基准显示出统计显著的改进。 在涉及工具使用的BioMysteryBench生物信息学问题上,职业简介组的解决率为46.7%,而最小化基线组为56.7%,差异达-10.0个百分点,主要原因是职业简介触发了更频繁的token和时间限制停止。值得注意的是,在SuperGPQA基准上,长提示词因API中断时的容错性表现出优势,正确首答率从基线的54.0%提升至71.6%,但这被归因于提示词长度或格式而非领域专业知识,因为通用和不匹配的提示词表现相当。 事实层面,针对Gemini 3.8 Flash模型和测试任务,默认加载完整职业简介无法提高准确性且成本更高;推断层面,当前行业流行的“越专业越好”的提示词工程策略可能缺乏实证支持;猜测层面,是否通过选择性检索简介片段或在开放式科学任务中应用能改变这一结论仍需进一步验证。

  13. arXiv cs.AI72

    K-Dense BYOK 发布支持本地运行且具备哈希链式实验记录的开源科研助手

    这篇来自 arXiv cs.AI 的论文介绍了 K-Dense BYOK,一个面向全领域科学家的免费开源 AI 研究助手,其核心特征是在研究人员本地计算机上运行并采用 Bring Your Own Keys(BYOK)模式接入用户自选模型。该系统不仅提供代码执行环境,还内置了科学流程库、工作流模板和数据目录,并通过“活体实验笔记本”记录研究过程,确保数据、代码和结果长期可读。 与通用聊天助手或编码代理不同,K-Dense BYOK 采用了独特的防幻觉机制:它通过监控智能体的实际行为生成不可被智能体修改的日志,而非依赖智能体自我报告,以此解决模型过度声称的问题。在针对二十个跨学科研究提示词的基准测试中,该工具在科学质量和研究执行两项指标上均领先于两个受管理的平台。其交付成果是唯一记录了所运行软件环境且通常附带可复现结果命令的方案,而对比平台即便使用相同前沿模型也未能提供此类环境记录。 事实层面,该工具代码以 MIT 许可证开源,包含 38 页正文、8 张图表及评分细则;推断层面,这种基于观察而非信任的日志设计可能成为未来高可靠性科研 Agent 的标准范式;猜测层面,当前日志尚未完全捕获软件环境本身,仅记录了文件写入行为,这暗示了后续版本在环境完整性验证上的改进空间。

  14. arXiv cs.AI68

    Qwen2.5-7B 上 PRM-Pruned Fragment Grafting 机制被证实为惰性:三项推理模型证据

    该研究通过严格的等价性检验发现,在 Qwen2.5-7B-Instruct 等三个基础大模型上,PRM-Pruned Fragment Grafting(PPFG)这一推理时干预机制在 MATH500 等六个基准测试中表现与独立并行思维链基线统计无差异。作者将 PPFG 定义为跨轨迹步骤级转移的成本最小化操作,但实测显示其在停滞和随机目标变体下均未带来性能提升,且分析表明这种惰性并非特定启发式算法导致。 深入归因分析揭示了机制失效的核心原因:对 322 次停滞规则注入事件的分类显示,仅 14% 真正针对了陷入困境的推理链,其余大部分被错误地 graft 到了已经成功、即将完成或处于平坦奖励曲面的链路上,这些状态下的“救援”无法产生改变。此外,尽管注入链的剪枝率是匹配步率的 2.75 倍,但幸存兄弟模型的反事实分析未发现群体层面的补偿效应,事后预言机估算的单题增益上限仅为 0.13 个百分点。 事实层面,该结论基于十二个 Qwen/LLaMA 单元的双单侧检验确立的正向等价关系;推断层面,这提示当前基于 PRM 剪枝的片段移植策略若缺乏精细的目标筛选与密度控制,极易沦为无效计算;猜测层面,未来若要激活此类机制,可能需要引入更复杂的复合门控优化而非简单的随机或停滞触发,但这仍需进一步验证。

  15. arXiv cs.AI78

    论文测量现成 SLM 在 Agent 微任务上的资格缺口:16 个 Qwen3 配置均未达阈值

    这篇 arXiv 论文测试现成小语言模型能否在 Agent harness 中承担围绕主 LLM 规划器的微任务,例如自动批准 shell 命令、写入记忆、选择工具和排序历史轮次。作者构建了 4 个固定提示、自动指标和预设阈值的基准,阈值锚定廉价非 LLM baseline,并要求配置的置信区间下界超过阈值才算合格。 在不调参、仅用 FP16、greedy 和单一冻结提示的条件下,Qwen3 0.6B、1.7B、4B、8B 的 16 个任务与模型组合全部未通过,作者通过检查原始输出和 parser 行为确认结果。logprob 决策阈值诊断把失败分为能力不足和可通过改变解码阈值修复两类;4-bit 量化(RTN/GPTQ/AWQ)造成的损害取决于模型规模,但没有让任何配置达到资格,且结果在 Llama-3.x 上复现,12 个配置均不合格,对阈值扫描和提示改写也稳健。 事实层面,论文给出的核心结论是现成 SLM 不能直接通过这类微任务的严格资格门槛。推断层面,作者建议把 SLM 放在已满足阈值要求的 baseline 之后,只在 baseline 失败时调用;例如 4B 模型对 BM25 短列表重排序可提升 0.047,但它本身仍未通过资格认证。猜测层面,这意味着 Agent 系统若追求低延迟或低成本,不应把关键微任务直接交给未校准的小模型,而应设计 baseline、阈值或级联机制来兜底。

    推荐理由:它用置信区间门槛证明现成小模型在 Agent 微任务上普遍不合格,提醒不要把 SLM 直接替换关键路由层。

  16. arXiv cs.AI78

    论文发现角色分工 QA 中推理链主要改变验证判断而非答案准确率

    这篇论文研究在角色分工 QA 流程中,reasoner 向 verifier 传递的 rationale 究竟提供了什么。作者在固定证据和候选答案的前提下,只改变跨边界传递的 rationale,并在 400 条 MuSiQue、HotpotQA 和 2WikiMultiHopQA 样本上用 DeepSeek 同时作为生成器和验证器进行测试。 结果显示,忠实 rationale 相比不传 rationale 对答案准确率几乎没有提升;但被破坏的 rationale 会显著改变 verifier 对支持关系的判断。盲验证提示下,无害改写只让支持判断偏移 0–2.5%,破坏性 rationale 则偏移 10–22%;显式 rationale-checking 提示会把同一模式放大到 34–55%。最终答案变化较小,为 2–30%,且只有 2.9–35.3% 的被破坏支持翻转同时伴随答案变化。人工审计进一步显示,42 个有效破坏样本中有 16 个属于 corruption-overtrust,而模型接受的 10 条被破坏 rationale 中有 9 条被人工拒绝或标记为不清楚。 该研究给出的事实是,rationale 共享不应只被评估为提高答案准确率的通道,更应被当作验证消息机制来评估。由此可以推断,多智能体 QA 或 Agent 流水线如果直接透传推理链,可能引入新的失败面:验证器会被表面连贯但实质损坏的解释牵引,而不是独立复核证据。论文中的跨模型与任务边界检查还表明,这一通道何时被放大、何时失效,取决于具体提示和任务结构。

    推荐理由:它把 rationale 传递从“提升答案”重新界定为“验证消息干预”,可改变多智能体 QA 中是否该透传推理链的设计判断。

  17. Hacker News · AI68

    Stratego 超人类 AI 研究展示训练成本只需数千美元

    这篇 arXiv 论文报告 Stratego 不完全信息博弈中的超人类 AI 结果,称达到顶级人类水平并实现远超人类的表现只需数千美元训练成本。摘要给出的事实是,此前数百万美元训练仍未达到顶级人类水平,本文通过 self-play reinforcement learning 和 test-time search 的通用方法实现性能与成本上的显著变化。可推断其降低不完全信息博弈研究门槛,但材料未给出具体模型、基准、对手或代码,不能据此判断产品化或通用能力。

  18. Hacker News · AI68

    基于两家公司生产轨迹的研究显示 LLM 前缀缓存中 LRU 优于复杂替换算法

    该论文通过分析两家公司的生产轨迹并评估 14 种驱逐算法,发现尽管 Belady 最优解与现有策略存在巨大差距,但在智能体工作负载下,针对传统缓存设计的复杂策略并未比 LRU 提供显著收益。核心原因在于前缀重用主要由活跃会话的规律节奏主导,使得最近使用记录(recency)具有异常高的预测性。 研究揭示了前缀缓存引入的新挑战,包括重尾分布的会话足迹以及随序列长度增长而急剧增加的注意力计算导致的可变缺失成本。作者引入了“计算节省率”指标和两个离线预言机来量化这些效应,并提出有效的管理策略应保留以近期性为基础,同时选择性添加对单次命中前缀的快速降级、针对高成本缺失的计算感知部分驱逐以及依赖容量的驱逐粒度调整。 事实层面,论文已公开相关轨迹数据和模拟器供后续研究使用;推断层面,这意味着当前许多试图用复杂算法优化 LLM 前缀缓存的工程投入可能收效甚微,应回归以 LRU 为基线的架构;猜测层面,若未来会话模式从规律节奏转向高度随机,上述结论可能需要重新评估,但基于当前数据,简单策略在 HBM 受限和大内存池设置下均表现稳健。