跳到正文
热点事件持续更新

Bi-QSTO攻击绕过数据筛选威胁模型安全

1 篇报道1 个报道来源9 小时前更新

先了解这件事

AI 综述

2026年10月2日,arXiv cs.CR发布论文提出Bi-QSTO攻击方法。该研究在显式质量约束下优化投毒样本,并显示即使经过高质量数据筛选,部分被保留的高质量样本仍可能削弱安全对齐大语言模型的安全表现。论文表明,仅依赖数据质量筛选不足以防御此类微调投毒攻击,安全对齐模型在筛选后仍可能受到安全性能下降的影响。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv cs.CR精选
    论文提出 Bi-QSTO 并显示高质量数据筛选后 LLM 微调仍可能被投毒削弱安全对齐

    论文提出 Bi-QSTO,在显式质量约束下优化毒样本,并显示质量筛选后部分保留的高质量样本仍可能降低安全对齐 LLM 的安全表现。 摘要先指出安全对齐 LLM 在少量有害或看似良性样本上微调仍脆弱,以往投毒研究常假设有害样本直接进入微调,而实际训练管线会先做质量筛选;该工作系统评估筛选对投毒的过滤效果和保留数据的下游安全影响,发现筛选能移除许多明显有害样本,但一些保留的高质量样本仍可能降低模型安全对齐,摘要将其可能归因于层级梯度层面的有害类训练更新模式。 在跨投毒设置、目标模型和过滤率的实验中,Bi-QSTO 在筛选前后保持攻击有效性;即使 90% 过滤,有害种子样本的 Poisoning Retention Rate 高于 90%,Harmful Score 为 3.30--4.01,且攻击效果强烈跨模型迁移,保留优势也泛化到额外筛选方法。事实是摘要报告了上述指标;推断是质量筛选不能替代安全对齐评估;猜测是仅依赖质量筛选或明显有害样本过滤的管线可能低估投毒风险。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。