研究:多智能体团队未显著提升质量且成本高昂
先了解这件事
Vals AI 于 2026 年 10 月 11 日发布的测试显示,将 GPT-6 Sol 和 Claude Opus 5.5 从单智能体扩展为团队模式时,成本增加 1.8 倍至 5.1 倍。在最大推理设置下,团队模式未给任何模型带来实质性优势;仅在 GPT-6 Sol 中等推理设置下获得 7.3 分的统计显著性提升。该结论与 Anthropic 内部测试及 OpenAI 研究人员观点一致,即更多智能体主要换取速度而非输出质量。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- The Decoder精选Vals AI 测试显示 AI 智能体团队在最大推理下几乎不提升质量且成本激增
Vals AI 对 GPT-6 Sol 和 Claude Opus 5.5 的实测表明,将模型从单智能体扩展为团队时,成本增加 1.8 倍至 5.1 倍,但仅在 GPT-6 Sol 中等推理设置下获得 7.3 分的统计显著性提升;在最大推理设置下,团队模式未给任何模型带来实质性优势。 这一结论与 Anthropic 内部测试及 OpenAI 研究人员的观点一致:更多智能体主要换取速度而非输出质量。在 ProgramBench 测试中,虽然任务完成时间随 Agent 数量增加而缩短,但 token 消耗同步上升,且 Fable 模型在知识库任务上从 30 个扩展到 100 个 Agent 时得分反而下降。OpenAI 研究员 Noam Brown 指出,Web 研究和数学并行化效果好,但写小说等任务无法通过堆叠 Agent 提升效果,Eric Provencher 则警告这种协调损耗构成了“协调税”。 事实层面,现有证据显示在算力已跑满的情况下,盲目扩大 Agent 规模会导致边际收益递减甚至归零。推断层面,当前流行的多智能体编排方案若缺乏特定场景优化,极可能只是增加了 Token 浪费而非解决复杂问题。猜测层面,未来架构竞争可能转向如何降低协调成本而非单纯增加 Agent 数量,但这需要进一步验证。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。