跳到正文
热点事件持续更新

混合智能体揭示大模型Token计算成本分布不均

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月5日,一项新研究提出基于混合智能体(MoA)的方法测量令牌计算成本。该研究构建包含三个家族、十五个容量递增语言模型的智能体面板,要求其在给定正确前序token条件下逐token复现参考序列。研究将能成功复现的最小智能体的推理成本定义为该token的“足够计算量”,以此挑战大模型对所有生成token分配相同计算量的传统假设,首次揭示了单个token所需实际推理计算量的分布不均情况。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv cs.AI
    论文通过混合智能体测量揭示大模型生成中 token 的计算成本分布不均

    该研究提出一种基于混合智能体(MoA)的方法,首次对单个 token 所需的实际推理计算量进行测量,挑战了大模型对所有生成 token 分配相同计算量的传统假设。作者构建了一个包含来自三个家族、容量递增的十五个语言模型的智能体面板,要求每个智能体在给定正确前序 token 的条件下逐 token 复现参考序列,并将能成功复现的最小智能体的推理成本定义为该 token 的“足够计算量”(sufficient compute),以此作为该 token 所需计算量的上界。 实验数据显示,在三个核心基准测试中,仅 0.5B 参数的小模型即可复现 92% 至 95% 的参考 token,表明绝大多数 token 并不需要高算力模型处理。然而,计算资源分配极不均衡:在 Qwen、OLMo 和 R1-distilled 等模型面板中,最昂贵的 10% 的 token 消耗了估计总 FLOPs 的 64% 至 80%。基于此 MoA 生成的计算地图,在 MATH-500 全集中应用模型路由可将投影延迟从 7.59 秒降至 5.12 秒且精度略有提升;在草稿机制中,该方法使草稿 token 数量减少 32.6%,投影延迟降低约 20%,同时保持相似精度。 事实层面,研究证实了 token 间计算需求的巨大差异及现有固定分配模式的低效性。推断层面,这种结构化的计算需求图谱为动态路由控制器和自适应草稿策略提供了明确的优化空间,可能推动推理引擎从静态架构向感知 token 难度的动态架构迁移。猜测层面,若此类方法被广泛集成,未来推理成本结构将发生根本性变化,但具体实施需解决实时计算地图生成的开销问题。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。