跳到正文
原文
arXiv cs.AI· Khawaja Murad ul Hassan, Mehran Ebrahimi·· 13 小时前AI 评分68

Qwen2.5-7B 上 PRM-Pruned Fragment Grafting 机制被证实为惰性:三项推理模型证据

Characterizing a Configuration Where Inference-Time PRM-Pruned Fragment Grafting Is Inert: Evidence from Three Reasoning LMs

AI 摘要

该研究通过严格的等价性检验发现,在 Qwen2.5-7B-Instruct 等三个基础大模型上,PRM-Pruned Fragment Grafting(PPFG)这一推理时干预机制在 MATH500 等六个基准测试中表现与独立并行思维链基线统计无差异。作者将 PPFG 定义为跨轨迹步骤级转移的成本最小化操作,但实测显示其在停滞和随机目标变体下均未带来性能提升,且分析表明这种惰性并非特定启发式算法导致。

深入归因分析揭示了机制失效的核心原因:对 322 次停滞规则注入事件的分类显示,仅 14% 真正针对了陷入困境的推理链,其余大部分被错误地 graft 到了已经成功、即将完成或处于平坦奖励曲面的链路上,这些状态下的“救援”无法产生改变。此外,尽管注入链的剪枝率是匹配步率的 2.75 倍,但幸存兄弟模型的反事实分析未发现群体层面的补偿效应,事后预言机估算的单题增益上限仅为 0.13 个百分点。

事实层面,该结论基于十二个 Qwen/LLaMA 单元的双单侧检验确立的正向等价关系;推断层面,这提示当前基于 PRM 剪枝的片段移植策略若缺乏精细的目标筛选与密度控制,极易沦为无效计算;猜测层面,未来若要激活此类机制,可能需要引入更复杂的复合门控优化而非简单的随机或停滞触发,但这仍需进一步验证。

来源:arXiv cs.AI · arxiv.org