跳到正文
热点事件持续更新

Qwen2.5-1.5B在RLVR训练中实现提示级差分隐私

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026年10月7日,一篇arXiv论文首次提出并证明了在强化学习可验证奖励(RLVR)训练中应用提示词级差分隐私的可行性。该研究针对Qwen2.5-1.5B-Instruct模型,将单个提示词的响应组视为隐私记录,通过聚合梯度、单次裁剪提示词贡献并添加高斯噪声来累积隐私损失。实验结果显示,在满足(ε,δ)-差分隐私约束下发布模型权重时,该方法仍能提升推理准确率。其核心机制在于隐私预算不依赖于每提示词的响应数量或裁剪范数。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.CR
    Qwen2.5-1.5B-Instruct在提示词级差分隐私下训练显示奖励信号仍提升推理准确率

    该论文首次在强化学习可验证奖励(RLVR)训练中提出并证明了提示词级差分隐私(prompt-level differential privacy)的可行性,即发布模型权重时,针对任意单个训练问题的存在性满足(ε,δ)-差分隐私。作者将单个提示词的响应组视为隐私记录,通过聚合梯度、单次裁剪提示词贡献并添加高斯噪声来累积隐私损失,且预算不依赖于每提示词的响应数量或裁剪范数。 实验使用Qwen2.5-1.5B-Instruct配合LoRA微调,在ε=8的预算下进行测试。结果显示,相比仅移除奖励信号的对照组,引入奖励信号使MATH和GSM8K任务准确率分别提升2.65和3.24分,且该提升在格式鲁棒评分器下仍保留1.3分优势,并非由响应长度差异导致。在相同隐私预算下,该私有模型在MATH和GSM8K上均优于两种监督微调方案,性能保持在非隐私GRPO基线增益的85%至90%,且即使预算收紧八倍,MATH任务损失不超过1.2分。 事实层面,该研究证实了Verifier反馈在强隐私约束下仍是可用的学习信号,并将效果扩展至CommonsenseQA等非数学任务。推断层面,这意味着未来处理敏感领域(如医疗、法律)的RLVR应用时,无需牺牲过多性能即可部署隐私保护机制。猜测层面,该方法是否适用于更大参数规模模型及更复杂的Agent工作流尚需进一步验证,但当前结果打破了“隐私必然严重损害RLVR性能”的假设。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。