The Decoder· Matthias Bastian·· 3 小时前精选AI 评分78
Vals AI 测试显示 AI 智能体团队在最大推理下几乎不提升质量且成本激增
AI agent teams waste massive tokens for barely measurable quality gains, research finds
AI 导读
Vals AI 对 GPT-6 Sol 和 Claude Opus 5.5 的实测表明,将模型从单智能体扩展为团队时,成本增加 1.8 倍至 5.1 倍,但仅在 GPT-6 Sol 中等推理设置下获得 7.3 分的统计显著性提升;在最大推理设置下,团队模式未给任何模型带来实质性优势。
这一结论与 Anthropic 内部测试及 OpenAI 研究人员的观点一致:更多智能体主要换取速度而非输出质量。在 ProgramBench 测试中,虽然任务完成时间随 Agent 数量增加而缩短,但 token 消耗同步上升,且 Fable 模型在知识库任务上从 30 个扩展到 100 个 Agent 时得分反而下降。OpenAI 研究员 Noam Brown 指出,Web 研究和数学并行化效果好,但写小说等任务无法通过堆叠 Agent 提升效果,Eric Provencher 则警告这种协调损耗构成了“协调税”。
事实层面,现有证据显示在算力已跑满的情况下,盲目扩大 Agent 规模会导致边际收益递减甚至归零。推断层面,当前流行的多智能体编排方案若缺乏特定场景优化,极可能只是增加了 Token 浪费而非解决复杂问题。猜测层面,未来架构竞争可能转向如何降低协调成本而非单纯增加 Agent 数量,但这需要进一步验证。
推荐理由
材料用 Vals AI 实测数据证明多智能体团队在最大推理下无质量增益,直接证伪当前主流架构假设。
来源:The Decoder · the-decoder.com