跳到正文
热点事件持续更新

SymCE与RLVR揭示LLM反例生成中的模仿陷阱

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月5日,研究团队发布论文指出大语言模型在定理证伪任务中存在‘模仿陷阱’。实验构建包含4,707个假命题的SymCE数据集,验证器作为奖励函数训练Qwen3-4B模型。结果显示,仅用反例进行监督微调会导致真定理识别率从0.27骤降至0.00,而采用基于稀疏结果奖励的GRPO强化学习则能修复此问题并将识别率提升至0.66。该现象在Gemma-3-4B模型上同样被观察到。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv cs.CL精选
    Qwen3-4B 在反例生成任务中暴露模仿陷阱且强化学习可修复性能

    该论文通过实验发现大语言模型在解决定理时存在证伪缺口,仅靠监督微调无法关闭反而可能恶化。作者构建了 SymCE 数据集,包含 4,707 个带可执行验证器的本科代数与实分析假命题,并将验证器作为奖励函数训练 Qwen3-4B 模型。结果显示,仅使用反例进行监督微调会导致真定理识别率从 0.27 骤降至 0.00,而采用基于稀疏结果奖励的 GRPO 强化学习则能修复此问题并将识别率提升至 0.66。 这一现象在 Gemma-3-4B 上复现,且稀疏奖励与密集奖励在域内表现无显著差异,但在保留校准探针上相差 33 分,归因于部分信用项的影响。尽管模型参数量仅为 4B,其表现仍优于所有被评估的 7B 开源数学专家模型,并与六个前沿商业 API 保持竞争力,且在未改变提示词的情况下成功迁移至 GSM8K、MATH-500 和 MMLU-college-math 任务。人工审计 177 个验证器决策显示准确率达 97.7%。 事实层面确认了反例微调对真定理认知的破坏性及其可修复性;推断表明当前主流微调范式在处理证伪任务时存在系统性缺陷;猜测认为未来数学推理模型的训练需更依赖验证器驱动的强化学习而非单纯的数据模仿。代码、数据及验证器模块已公开。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。