跳到正文
原文
arXiv cs.CR· Kaiyang Li, Jiahao Chen, Yuwen Pu, Chunyi Zhou, Tong Zhang, Bin Cai, Chunqiang Hu, Haibo Hu·· 9 小时前精选AI 评分78

论文提出 Bi-QSTO 并显示高质量数据筛选后 LLM 微调仍可能被投毒削弱安全对齐

High-quality Data Do not Mean Safe! Poisoning LLMs after Data Selection

AI 导读

论文提出 Bi-QSTO,在显式质量约束下优化毒样本,并显示质量筛选后部分保留的高质量样本仍可能降低安全对齐 LLM 的安全表现。

摘要先指出安全对齐 LLM 在少量有害或看似良性样本上微调仍脆弱,以往投毒研究常假设有害样本直接进入微调,而实际训练管线会先做质量筛选;该工作系统评估筛选对投毒的过滤效果和保留数据的下游安全影响,发现筛选能移除许多明显有害样本,但一些保留的高质量样本仍可能降低模型安全对齐,摘要将其可能归因于层级梯度层面的有害类训练更新模式。

在跨投毒设置、目标模型和过滤率的实验中,Bi-QSTO 在筛选前后保持攻击有效性;即使 90% 过滤,有害种子样本的 Poisoning Retention Rate 高于 90%,Harmful Score 为 3.30--4.01,且攻击效果强烈跨模型迁移,保留优势也泛化到额外筛选方法。事实是摘要报告了上述指标;推断是质量筛选不能替代安全对齐评估;猜测是仅依赖质量筛选或明显有害样本过滤的管线可能低估投毒风险。

推荐理由

它把数据质量筛选从安全假设变成可攻击面,能改变对训练数据清洗、微调安全评估和投毒检测阈值的判断。

来源:arXiv cs.CR · arxiv.org