arXiv cs.CL· Omar Farouk Zouak, Houssam Eddine Boukhalfa, Soumaya Lakehal, Shiv Katiyar, Samia Nefti-Meziani·· 3 小时前精选AI 评分78
Qwen3-4B 在反例生成任务中暴露模仿陷阱且强化学习可修复性能
Counterexample Generation via Per-Theorem Symbolic Verifiers: When Imitation Hurts and Reinforcement Repairs
AI 导读
该论文通过实验发现大语言模型在解决定理时存在证伪缺口,仅靠监督微调无法关闭反而可能恶化。作者构建了 SymCE 数据集,包含 4,707 个带可执行验证器的本科代数与实分析假命题,并将验证器作为奖励函数训练 Qwen3-4B 模型。结果显示,仅使用反例进行监督微调会导致真定理识别率从 0.27 骤降至 0.00,而采用基于稀疏结果奖励的 GRPO 强化学习则能修复此问题并将识别率提升至 0.66。
这一现象在 Gemma-3-4B 上复现,且稀疏奖励与密集奖励在域内表现无显著差异,但在保留校准探针上相差 33 分,归因于部分信用项的影响。尽管模型参数量仅为 4B,其表现仍优于所有被评估的 7B 开源数学专家模型,并与六个前沿商业 API 保持竞争力,且在未改变提示词的情况下成功迁移至 GSM8K、MATH-500 和 MMLU-college-math 任务。人工审计 177 个验证器决策显示准确率达 97.7%。
事实层面确认了反例微调对真定理认知的破坏性及其可修复性;推断表明当前主流微调范式在处理证伪任务时存在系统性缺陷;猜测认为未来数学推理模型的训练需更依赖验证器驱动的强化学习而非单纯的数据模仿。代码、数据及验证器模块已公开。
推荐理由
揭示仅用反例微调会摧毁定理识别能力,而稀疏奖励强化学习可修复并超越基线。
来源:arXiv cs.CL · arxiv.org