跳到正文
热点事件持续更新

ReGap攻击可恢复微调后模型隐私

1 篇报道1 个报道来源10 小时前更新

先了解这件事

AI 综述

2026年10月2日,arXiv cs.CR 上一篇论文提出名为 ReGap 的攻击方法,关注语言模型在微调后仍可能重新暴露隐私关联的问题。报道称,ReGap 不需要真实私有监督数据,而是通过 LLM 生成候选答案,并利用任务结构、答案 token 似然过滤和低秩适配进行微调,从而恢复目标模型中已经不再直接可查询的隐私对应关系。作者指出,先前攻击通常要求攻击者掌握与原始训练数据同分布的真实私有监督数据,而 ReGap 只依赖上述替代信号即可实现类似恢复。目前报道仅介绍了该论文提出的方法与结论,未提供实验规模、受影响模型或防御措施等进一步细节。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv cs.CR精选
    ReGap 显示微调可重新唤醒语言模型中的隐私关联

    这篇 arXiv 论文提出 ReGap,一种无需真实私有监督数据的微调攻击方法,可通过 LLM 生成的候选答案恢复语言模型中已经不再直接可查询的隐私关联。作者认为,先前攻击要求攻击者掌握与原始训练数据同分布的真实私有监督,而 ReGap 只依赖任务结构、答案 token 似然过滤和低秩适配,就能让目标模型重新暴露此前学到的私有对应关系。 实验覆盖 6 个 GPT-2、OPT 和 Qwen3 模型,ReGap 相比微调后的目标模型把目标关联恢复率提高 6 到 21 个百分点。即使适配使用的身份与模型记忆和评测身份完全不重合,且生成或筛选出的监督中没有出现准确目标答案,恢复效果仍然明显。论文还对比了曾接触目标数据的检查点和从未接触目标数据的匹配检查点:同一组训练后的 adapter 把前者的恢复率从 42% 提升到 63%,但对后者没有增益,说明仅靠适配过程不足以解释恢复,模型此前是否接触过目标数据会显著影响后续可恢复性。 事实是论文给出了无数据微调恢复攻击的方法和实验结果。推断是常规模型定制可能激活潜在隐私风险,尤其对曾接触敏感数据的检查点更危险。猜测是这一机制会促使模型定制流程在 adapter 训练、检查点管理和隐私审计上增加新的防护需求。

本事件热度走势

当前热度 8·可比范围峰值 8(10月2日 20:00)·近 24 小时可比范围变化 –

0246810月2日20:0010月2日21:0010月2日21:0010月2日22:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。