跳到正文
原文
arXiv cs.CR· Jiachen Zhao, Antonia Januszewicz, Taeho Jung·· 5 小时前AI 评分70

Qwen2.5-1.5B-Instruct在提示词级差分隐私下训练显示奖励信号仍提升推理准确率

Reward-Driven Learning under Prompt-Level Differential Privacy

AI 摘要

该论文首次在强化学习可验证奖励(RLVR)训练中提出并证明了提示词级差分隐私(prompt-level differential privacy)的可行性,即发布模型权重时,针对任意单个训练问题的存在性满足(ε,δ)-差分隐私。作者将单个提示词的响应组视为隐私记录,通过聚合梯度、单次裁剪提示词贡献并添加高斯噪声来累积隐私损失,且预算不依赖于每提示词的响应数量或裁剪范数。

实验使用Qwen2.5-1.5B-Instruct配合LoRA微调,在ε=8的预算下进行测试。结果显示,相比仅移除奖励信号的对照组,引入奖励信号使MATH和GSM8K任务准确率分别提升2.65和3.24分,且该提升在格式鲁棒评分器下仍保留1.3分优势,并非由响应长度差异导致。在相同隐私预算下,该私有模型在MATH和GSM8K上均优于两种监督微调方案,性能保持在非隐私GRPO基线增益的85%至90%,且即使预算收紧八倍,MATH任务损失不超过1.2分。

事实层面,该研究证实了Verifier反馈在强隐私约束下仍是可用的学习信号,并将效果扩展至CommonsenseQA等非数学任务。推断层面,这意味着未来处理敏感领域(如医疗、法律)的RLVR应用时,无需牺牲过多性能即可部署隐私保护机制。猜测层面,该方法是否适用于更大参数规模模型及更复杂的Agent工作流尚需进一步验证,但当前结果打破了“隐私必然严重损害RLVR性能”的假设。

来源:arXiv cs.CR · arxiv.org