跳到正文
原文
arXiv cs.AI· Wenhui Chen·· 1 天前精选AI 评分68

论文证明数据排列改变的是模型对冲突约定的承诺而非能力

Conflicting Supervision Moves Commitment, Not Capability: A 12.29{\sigma} arrangement effect that is exactly zero under a convention-agnostic score

AI 导读

这篇 arXiv 论文研究在同一批问题以两种互不兼容但都正确的约定书写时,训练数据排列会向模型参数写入什么。作者提出学习率调度不是背景条件,而是平均算子,并证明排列与调度在顺序效应中以分离乘积形式进入:排列只作为块周期出现,调度只决定端点能对训练中某一时刻赋予多大权重。

实验固定语料、预算和其他条件,只改变十种排列路径,并在不同 lr_scheduler_type 下各跑两次。常数学习率下,十种排列在分配上跨越 0.2221,对比下限达 11.63,且随排列更块状而单调变化;在单一 cosine 调度下,同样十种排列只落入两个可区分状态。论文测得 12.29σ 的排列切换,但在约定无关评分下恰好为零:十二个臂的 acc_A+acc_B 在 9.7% 内保持恒定,而分配份额从 0.04 到 0.87 变化;在提示中标明约定后,切换消失并达到 union ceiling 的 87.5%。

事实是论文给出了排列效应的机制分解与受控测量。推断是这类效应解释的是模型选择承诺哪一套约定,而不是总体能力高低。猜测是仅用 exact-match 或总分基准评估预训练数据顺序,可能系统性漏掉这种承诺偏移。

推荐理由

它把数据顺序影响从能力差异改写为约定承诺差异,提醒训练顺序评估不能只看总分基准。

来源:arXiv cs.AI · arxiv.org