LADE 提出利用首词概率暗知识构建模型无关安全信号
先了解这件事
2026年10月7日,arXiv cs.CR发布论文提出LADE(Latent Safety Signals for Defense)。该方法旨在解决现有解码阶段防御在提升安全性时导致过度拒绝、以及依赖特定架构内部隐藏状态而缺乏通用性的问题。LADE的核心洞察是,除了表面的拒绝令牌外,首词分布中的暗知识(即超出argmax的信息)包含区分有害与良性查询的潜在安全信号,这些信号在不同LLM间具有一致性,形成源自安全对模型的通用防御机制。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv cs.CRLADE 利用首词概率分布中的暗知识构建模型无关的 LLM 安全防御信号
该论文提出 LADE(Latent Safety Signals for Defense),一种从大语言模型首词输出概率分布中提取潜在安全信号的防御方法,旨在解决现有解码阶段防御在提升安全性时导致过度拒绝、以及依赖特定架构内部隐藏状态而缺乏通用性的问题。LADE 的核心洞察是,除了表面的拒绝令牌外,首词分布中的暗知识(即超出 argmax 的信息)包含区分有害与良性查询的潜在安全信号,这些信号在不同 LLM 间具有一致性,形成源自安全对齐的模型无关方向。 LADE 由三个组件构成:首先从暗知识中提取潜在安全信号,选择首词概率分布中前 k 个最具安全判别力的令牌;其次通过分词器映射将这些令牌跨不同分词器进行转换,实现模型无关应用;最后基于 kNN 搜索对映射后的令牌进行分类以判别查询意图。实验显示,LADE 在多种 LLM 和基准测试中能有效抵御广泛的越狱攻击,降低攻击成功率的同时保持了具有竞争力的安全 - 效用权衡。 事实层面,该方法仅依赖首词输出概率分布,不访问内部隐藏状态,理论上可应用于任何架构的模型。推断层面,这种基于暗知识的特征提取可能成为未来轻量级、通用安全防御的标准范式,减少对特定模型微调或内部状态的依赖。猜测层面,其实际部署效果是否受限于特定分词器的映射精度,以及在极端对抗样本下的鲁棒性仍需更多工业界实测验证。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。