跳到正文
原文
arXiv cs.AI· Zhixu Du, Weijia Han, Hai Helen Li, Yiran Chen·· 4 小时前AI 评分72

论文通过混合智能体测量揭示大模型生成中 token 的计算成本分布不均

What Does a Token Cost? A Mixture-of-Agents Measurement of Sufficient Per-Token Compute

AI 摘要

该研究提出一种基于混合智能体(MoA)的方法,首次对单个 token 所需的实际推理计算量进行测量,挑战了大模型对所有生成 token 分配相同计算量的传统假设。作者构建了一个包含来自三个家族、容量递增的十五个语言模型的智能体面板,要求每个智能体在给定正确前序 token 的条件下逐 token 复现参考序列,并将能成功复现的最小智能体的推理成本定义为该 token 的“足够计算量”(sufficient compute),以此作为该 token 所需计算量的上界。

实验数据显示,在三个核心基准测试中,仅 0.5B 参数的小模型即可复现 92% 至 95% 的参考 token,表明绝大多数 token 并不需要高算力模型处理。然而,计算资源分配极不均衡:在 Qwen、OLMo 和 R1-distilled 等模型面板中,最昂贵的 10% 的 token 消耗了估计总 FLOPs 的 64% 至 80%。基于此 MoA 生成的计算地图,在 MATH-500 全集中应用模型路由可将投影延迟从 7.59 秒降至 5.12 秒且精度略有提升;在草稿机制中,该方法使草稿 token 数量减少 32.6%,投影延迟降低约 20%,同时保持相似精度。

事实层面,研究证实了 token 间计算需求的巨大差异及现有固定分配模式的低效性。推断层面,这种结构化的计算需求图谱为动态路由控制器和自适应草稿策略提供了明确的优化空间,可能推动推理引擎从静态架构向感知 token 难度的动态架构迁移。猜测层面,若此类方法被广泛集成,未来推理成本结构将发生根本性变化,但具体实施需解决实时计算地图生成的开销问题。

来源:arXiv cs.AI · arxiv.org