UC Santa Cruz团队提出PEV方法攻破开源LLM安全防御
先了解这件事
2026年10月7日,加州大学圣克鲁兹分校团队在arXiv发表论文,提出名为“扰动嵌入向量”(PEV)的新攻击手段。该方法通过在提示词嵌入表示中添加独立高斯噪声并重复采样,成功越狱了六种不同规模的开源大语言模型。实验显示,PEV无需梯度计算、逐提示词优化或修改模型权重,且首次成功攻击的平均计算成本比先前方法低一个数量级。该研究指出这些模型在JailbreakBench基准测试中均存在一致的安全漏洞。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv cs.CR精选UC Santa Cruz 团队提出 PEV 方法以随机嵌入扰动攻破六款开源大模型安全防御
加州大学圣克鲁兹分校团队在 arXiv 发表论文,指出六种不同规模的开源权重大语言模型(Open-Weight LLMs)在 JailbreakBench 基准测试中均存在一致的安全漏洞,可通过一种名为“扰动嵌入向量”(PEV)的新攻击手段被成功越狱。该攻击仅需在提示词的嵌入表示中添加独立的高斯噪声并重复采样,无需进行梯度计算、逐提示词优化或修改模型内部权重。 实验数据显示,PEV 方法的首次成功攻击平均计算成本比先前方法低一个数量级,且能在每款被测模型上于一分钟内完成对新提示的越狱。该方法在所有测试模型和所有 JailbreakBench 提示词上均能生成不安全响应,而其他测试方法虽运行时间更长却未能达到同等覆盖率。论文强调,虽然嵌入向量扰动构成重大安全风险,但理解模型在此类扰动下的行为也是探索模型动态特性的重要研究方向。 事实层面确认了 PEV 攻击的低成本与高成功率,推断表明当前开源模型的嵌入层可能缺乏针对此类非参数化扰动的鲁棒性保护机制。推测未来针对端侧或低成本部署场景的模型安全评估需将此类简单物理层扰动纳入常规测试范畴,但这仍属于基于现有实验结果的行业推论而非既定事实。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。