跳到正文

#DeepSeek

今日 3 条
今天10月2日周五
  1. arXiv cs.AI75

    研究发现模型与 Agent 框架的配对会逆转性能排名且成本不决定表现

    该论文评估了 66 种配置,包括四种可配置框架(OpenHands、DeepSeek Harness、PI、openJiuwen)与五个模型的组合,在 TUA-Bench、ALE-CLI 和 Terminal-Bench 4 上测试发现,模型排名随框架变化而反转。例如在 Terminal-Bench 4 上,Claude 在 OpenHands 中领先 GPT 7.94 分,但在 PI 中落后 30.16 分。对于五分之四的模型,最佳框架在不同基准间并不一致,但部分配对具有稳定性,如 openJiuwen 使 Kimi 在所有三个基准上得分最高,提升幅度为 5.61 至 11.11 分。 证据细节显示,厂商原生框架并非总是最优解,且更高成本不能保证更高分数。GPT 在 PI 框架下的得分高于 DeepSeek Harness,但任务成本不足四分之一。轨迹匹配分析表明,模型自身处理修复的能力是关键变量,框架将失败反馈给模型的形式决定了最终效果:GPT 适应 PI 的轻量级脚手架,而经常发出格式错误工具调用的 Kimi 则在 openJiuwen 中表现最佳。 事实层面,研究已发布所有 6,204 条评分轨迹、代码及适配器;推断层面,这意味着单纯比较模型能力或框架能力的指标可能误导选型,必须结合具体任务场景进行联合评估;猜测层面,未来可能出现针对特定模型优化的专用框架,而非通用型框架通吃市场。

  2. arXiv cs.AI78

    论文发现角色分工 QA 中推理链主要改变验证判断而非答案准确率

    这篇论文研究在角色分工 QA 流程中,reasoner 向 verifier 传递的 rationale 究竟提供了什么。作者在固定证据和候选答案的前提下,只改变跨边界传递的 rationale,并在 400 条 MuSiQue、HotpotQA 和 2WikiMultiHopQA 样本上用 DeepSeek 同时作为生成器和验证器进行测试。 结果显示,忠实 rationale 相比不传 rationale 对答案准确率几乎没有提升;但被破坏的 rationale 会显著改变 verifier 对支持关系的判断。盲验证提示下,无害改写只让支持判断偏移 0–2.5%,破坏性 rationale 则偏移 10–22%;显式 rationale-checking 提示会把同一模式放大到 34–55%。最终答案变化较小,为 2–30%,且只有 2.9–35.3% 的被破坏支持翻转同时伴随答案变化。人工审计进一步显示,42 个有效破坏样本中有 16 个属于 corruption-overtrust,而模型接受的 10 条被破坏 rationale 中有 9 条被人工拒绝或标记为不清楚。 该研究给出的事实是,rationale 共享不应只被评估为提高答案准确率的通道,更应被当作验证消息机制来评估。由此可以推断,多智能体 QA 或 Agent 流水线如果直接透传推理链,可能引入新的失败面:验证器会被表面连贯但实质损坏的解释牵引,而不是独立复核证据。论文中的跨模型与任务边界检查还表明,这一通道何时被放大、何时失效,取决于具体提示和任务结构。

    推荐理由:它把 rationale 传递从“提升答案”重新界定为“验证消息干预”,可改变多智能体 QA 中是否该透传推理链的设计判断。