arXiv cs.CR· Abhinav Sudhakar Dubey (University of California Santa Cruz), Scott Sirri (University of California Santa Cruz), Vaggos Chatziafratis (University of California Santa Cruz), C. Seshadhri (University of California Santa Cruz)·· 4 小时前精选AI 评分80
UC Santa Cruz 团队提出 PEV 方法以随机嵌入扰动攻破六款开源大模型安全防御
Jailbreaking Open-Weight LLMs via Random Embedding Perturbations
AI 导读
加州大学圣克鲁兹分校团队在 arXiv 发表论文,指出六种不同规模的开源权重大语言模型(Open-Weight LLMs)在 JailbreakBench 基准测试中均存在一致的安全漏洞,可通过一种名为“扰动嵌入向量”(PEV)的新攻击手段被成功越狱。该攻击仅需在提示词的嵌入表示中添加独立的高斯噪声并重复采样,无需进行梯度计算、逐提示词优化或修改模型内部权重。
实验数据显示,PEV 方法的首次成功攻击平均计算成本比先前方法低一个数量级,且能在每款被测模型上于一分钟内完成对新提示的越狱。该方法在所有测试模型和所有 JailbreakBench 提示词上均能生成不安全响应,而其他测试方法虽运行时间更长却未能达到同等覆盖率。论文强调,虽然嵌入向量扰动构成重大安全风险,但理解模型在此类扰动下的行为也是探索模型动态特性的重要研究方向。
事实层面确认了 PEV 攻击的低成本与高成功率,推断表明当前开源模型的嵌入层可能缺乏针对此类非参数化扰动的鲁棒性保护机制。推测未来针对端侧或低成本部署场景的模型安全评估需将此类简单物理层扰动纳入常规测试范畴,但这仍属于基于现有实验结果的行业推论而非既定事实。
推荐理由
揭示无需梯度计算的嵌入层扰动即可突破六款开源模型防线,修正对轻量级对抗攻击成本的认知。
来源:arXiv cs.CR · arxiv.org