跳到正文
原文
arXiv cs.AI· Yuxuan Fan, Jaehong Yoon·· 4 小时前AI 评分65

MetaRubric 通过证据感知优化解决基于量表的强化学习中虚假得分问题

MetaRubric: Learning to Reward for Rubric-Based Reinforcement Learning

AI 摘要

该论文针对基于量表的强化学习(Rubric-based RL)中存在的“虚假得分”(Vacuous Credit)失效模式提出 MetaRubric 方法,即当响应中缺失所需信息或行动时,评分器仍可能给出高分,导致奖励信号失真甚至反转 GRPO 优势。MetaRubric 通过交替执行证据感知的策略优化与响应引导的量表调整来解决此问题。

核心机制包含两个关键步骤:首先构建反事实样本,即在每个提示词中仅更改一个任务相关事实;在策略优化阶段,仅当响应包含满足量表标准所需的充分证据时才分配信用。其次,在每个策略优化阶段后,利用当前策略生成的响应来修订原始及反事实的标准,同时保留原提示词在特定事实解释下的初始量表含义,并动态调整标准权重以应对观察到的策略错误。实验显示,该方法在多个骨干模型上使 PubMedQA 准确率提升 6.00 至 20.40 个百分点,并在 HealthBench-Hard 及两个多模态医疗基准测试中获得进一步增益。

事实层面确认了现有量表评分机制在开放任务中存在逻辑漏洞,且 MetaRubric 在特定医疗数据集上显著提升了准确性。推断层面表明,引入证据验证和反事实对比能有效增强模型对复杂指令的遵循能力,减少幻觉导致的错误奖励。猜测层面认为,该方法若推广至通用领域,可能改变当前依赖静态评分器的 RLHF 范式,但其在非结构化任务中的泛化效果仍需更多数据验证。

来源:arXiv cs.AI · arxiv.org