arXiv cs.CR· Jianhong Li, Jiahao Chen, Yuwen Pu, Chunyi Zhou, Oubo Ma, Zhou Feng, Hangtao Zhang, Jichao Bi, Chunqiang Hu·· 10 小时前精选AI 评分78
ReGap 显示微调可重新唤醒语言模型中的隐私关联
Sleeping Secrets: How Fine-Tuning Reawakens Privacy Risks in Language Models
AI 导读
这篇 arXiv 论文提出 ReGap,一种无需真实私有监督数据的微调攻击方法,可通过 LLM 生成的候选答案恢复语言模型中已经不再直接可查询的隐私关联。作者认为,先前攻击要求攻击者掌握与原始训练数据同分布的真实私有监督,而 ReGap 只依赖任务结构、答案 token 似然过滤和低秩适配,就能让目标模型重新暴露此前学到的私有对应关系。
实验覆盖 6 个 GPT-2、OPT 和 Qwen3 模型,ReGap 相比微调后的目标模型把目标关联恢复率提高 6 到 21 个百分点。即使适配使用的身份与模型记忆和评测身份完全不重合,且生成或筛选出的监督中没有出现准确目标答案,恢复效果仍然明显。论文还对比了曾接触目标数据的检查点和从未接触目标数据的匹配检查点:同一组训练后的 adapter 把前者的恢复率从 42% 提升到 63%,但对后者没有增益,说明仅靠适配过程不足以解释恢复,模型此前是否接触过目标数据会显著影响后续可恢复性。
事实是论文给出了无数据微调恢复攻击的方法和实验结果。推断是常规模型定制可能激活潜在隐私风险,尤其对曾接触敏感数据的检查点更危险。猜测是这一机制会促使模型定制流程在 adapter 训练、检查点管理和隐私审计上增加新的防护需求。
推荐理由
它把微调从性能工具改判为隐私恢复通道,能改变对模型定制阶段数据泄露风险的评估。
来源:arXiv cs.CR · arxiv.org