PPFG机制在推理时无法提升模型表现
先了解这件事
2026年10月2日,一项关于Qwen2.5-7B等三个基础大模型的研究证实,PRM-Pruned Fragment Grafting(PPFG)这一推理时干预机制表现为惰性。该研究通过严格的等价性检验发现,在MATH500等六个基准测试中,PPFG的表现与独立并行思维链基线统计无差异。尽管作者将PPFG定义为跨轨迹步骤级转移的成本最小化操作,但实测显示其在停滞和随机目标变体下均未带来性能提升,且分析表明这种惰性并非特定启发式算法导致。深入归因分析揭示了机制失效的核心原因。
AI 根据报道生成 · 3 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv cs.AIQwen2.5-7B 上 PRM-Pruned Fragment Grafting 机制被证实为惰性:三项推理模型证据
该研究通过严格的等价性检验发现,在 Qwen2.5-7B-Instruct 等三个基础大模型上,PRM-Pruned Fragment Grafting(PPFG)这一推理时干预机制在 MATH500 等六个基准测试中表现与独立并行思维链基线统计无差异。作者将 PPFG 定义为跨轨迹步骤级转移的成本最小化操作,但实测显示其在停滞和随机目标变体下均未带来性能提升,且分析表明这种惰性并非特定启发式算法导致。 深入归因分析揭示了机制失效的核心原因:对 322 次停滞规则注入事件的分类显示,仅 14% 真正针对了陷入困境的推理链,其余大部分被错误地 graft 到了已经成功、即将完成或处于平坦奖励曲面的链路上,这些状态下的“救援”无法产生改变。此外,尽管注入链的剪枝率是匹配步率的 2.75 倍,但幸存兄弟模型的反事实分析未发现群体层面的补偿效应,事后预言机估算的单题增益上限仅为 0.13 个百分点。 事实层面,该结论基于十二个 Qwen/LLaMA 单元的双单侧检验确立的正向等价关系;推断层面,这提示当前基于 PRM 剪枝的片段移植策略若缺乏精细的目标筛选与密度控制,极易沦为无效计算;猜测层面,未来若要激活此类机制,可能需要引入更复杂的复合门控优化而非简单的随机或停滞触发,但这仍需进一步验证。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。