跳到正文
原文
arXiv cs.CR· Anna Yoo Jeong Ha, Ronik Bhaskar, Haitao Zheng, Ben Y. Zhao·· 6 小时前AI 评分70

Whiteout 通过精确混淆样本防止大语言模型泄露个人敏感信息

Mitigating Private Data Leakage in LLMs with Whiteout

AI 摘要

该论文提出名为 Whiteout 的工具,旨在解决大语言模型因训练数据未过滤而记忆并复现个人敏感信息(PSI)的问题。与现有依赖机器遗忘的方法不同,Whiteout 允许个体请求时,使用精心设计的混淆样本覆盖模型中存储的真实 PSI,从而阻止模型再生成这些敏感内容。

评估结果显示,Whiteout 在多种规模和厂商的现代 LLM 上均能有效防止目标 PSI 的披露,且对模型效用和安全性影响可忽略不计。该方法不仅优于现有替代方案,还通过了包括黑盒越狱攻击和白盒自适应攻击(如重学习和量化)在内的广泛对抗测试。

事实层面,Whiteout 利用覆盖技术而非删除技术来消除记忆;推断层面,这种机制可能比传统遗忘方法更难以被逆向工程或绕过;猜测层面,该工具若被大规模采用,将改变当前针对高管、政客等高风险人群的隐私保护策略,但具体落地需考虑伦理审查与执行成本。

来源:arXiv cs.CR · arxiv.org