arXiv cs.CR· Yi Wang, Xiuyuan Qi, Dongqi Han, Dongsheng Li, Wenjie Wang·· 5 小时前AI 评分75
论文发现循环语言模型在不同推理深度的安全性存在差异且攻击可跨深度迁移
Safe at One Loop, Risky at Another: Aligning Safety Across Recurrent Depths in Looped Language Models
AI 摘要
这篇arXiv论文评估了循环语言模型(LoopLM)在针对不同推理深度的越狱攻击下的安全性,发现攻击成功率随推理深度增加而上升,同一查询在不同深度会触发不同的安全行为,且针对某一深度构建的攻击能迁移到其他深度。作者指出,现有的监督微调(SFT)和偏好对齐方法无法消除这些安全差距,因此提出了一种专为LoopLM设计的安全对齐方法SafeBridge。
SafeBridge结合了轻量级的深度特定共享循环层控制、选择性状态桥接以及跨推理深度的联合安全监督。实验结果显示,该方法在多种模型规模、多种攻击方法和多个安全基准上,显著降低了匹配深度和跨深度攻击的成功率,同时在保持与原始模型相当的过度拒绝行为的同时,提升了通用效用。这一发现表明,不能仅从单一推理深度推断LoopLM的整体安全性,必须在整个循环计算过程中进行安全对齐。
事实层面,论文证实了LoopLM存在深度依赖的安全漏洞及攻击迁移性;推断层面,这意味着当前通用的对齐策略可能不足以保障此类高效扩展架构的部署安全;猜测层面,未来针对LoopLM的合规审查可能需要引入多深度测试标准,但具体实施细节仍需等待代码开源后的进一步验证。
来源:arXiv cs.CR · arxiv.org