跳到正文
热点事件持续更新

SafeBridge提出以解决LoopLM跨深度安全对齐问题

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026年10月9日,一篇arXiv论文评估了循环语言模型(LoopLM)在不同推理深度下的安全性。研究发现,越狱攻击成功率随推理深度增加而上升,且针对某一深度构建的攻击可迁移至其他深度。现有监督微调(SFT)和偏好对齐方法无法消除这些安全差距。为此,作者提出了专为LoopLM设计的安全对齐方法SafeBridge,该方法结合了轻量级的深度特定共享循环层控制、选择性状态桥接以及跨推理深度的机制。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv cs.CR
    论文发现循环语言模型在不同推理深度的安全性存在差异且攻击可跨深度迁移

    这篇arXiv论文评估了循环语言模型(LoopLM)在针对不同推理深度的越狱攻击下的安全性,发现攻击成功率随推理深度增加而上升,同一查询在不同深度会触发不同的安全行为,且针对某一深度构建的攻击能迁移到其他深度。作者指出,现有的监督微调(SFT)和偏好对齐方法无法消除这些安全差距,因此提出了一种专为LoopLM设计的安全对齐方法SafeBridge。 SafeBridge结合了轻量级的深度特定共享循环层控制、选择性状态桥接以及跨推理深度的联合安全监督。实验结果显示,该方法在多种模型规模、多种攻击方法和多个安全基准上,显著降低了匹配深度和跨深度攻击的成功率,同时在保持与原始模型相当的过度拒绝行为的同时,提升了通用效用。这一发现表明,不能仅从单一推理深度推断LoopLM的整体安全性,必须在整个循环计算过程中进行安全对齐。 事实层面,论文证实了LoopLM存在深度依赖的安全漏洞及攻击迁移性;推断层面,这意味着当前通用的对齐策略可能不足以保障此类高效扩展架构的部署安全;猜测层面,未来针对LoopLM的合规审查可能需要引入多深度测试标准,但具体实施细节仍需等待代码开源后的进一步验证。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。