跳到正文
原文
arXiv cs.CL· Tao Shi, Chaoyi Xiang, Qiongkai Xu, Jey Han Lau·· 6 小时前AI 评分72

OLMo-Detect 基准测试显示大语言模型成员推断在跨域和大规模下表现受限

OLMo-Detect: A Multi-Stage, Confounder-Controlled Benchmark for Membership Inference on Large Language Models

AI 摘要

该研究提出 OLMo-Detect,一个基于全开源 OLMo 2 管道的多阶段、混淆变量控制基准,旨在评估大型语言模型的成员推断攻击有效性。实验覆盖预训练、中训练和后训练三个阶段,通过 infini-gram 严格过滤非成员样本,并引入分布偏移变体 OLMo-Detect (Shifted) 以测试鲁棒性。结果显示,在无监督和有监督的 18 种攻击中,最佳 AUC 仅为 0.68,且无监督方法在分布偏移下 AUC 波动高达 0.42,表明现有攻击在真实场景下的可靠性存疑。

深入分析发现,成员推断性能并非单纯由训练阶段决定,而是受数据类型驱动:经过筛选的数学数据比其他类型数据更容易被检测到。此外,随着模型参数量从 1B 增至 13B,检测分数有所提升,但在达到 32B 后出现 plateau(平台期),不再随规模扩大而显著改善。这一现象暗示单纯增加算力或参数规模并不能线性提升隐私泄露风险的可探测性。

事实层面,本研究证实了 OLMo 2 系列模型在特定数据分布下的脆弱性,并观察到性能峰值出现在中训练阶段。推断层面,这意味着针对通用文本数据的成员推断攻击可能无法像预期那样高效,尤其是在面对大规模模型时。猜测层面,若未来模型训练更多依赖高质量数学或代码数据,其隐私边界可能会比纯文本模型更清晰,但这需要进一步验证。研究结论强调,当前基准测试需改进分布对齐与过滤机制,否则难以准确反映模型真实的隐私状态。

来源:arXiv cs.CL · arxiv.org