arXiv cs.CR· Wonjun Lee, Kyungsik Yang, Gaeun Ji, Vaidehi Patil, Haon Park, Bumsub Ham, Mohit Bansal, Suhyun Kim·· 6 小时前AI 评分65
LADE 利用首词概率分布中的暗知识构建模型无关的 LLM 安全防御信号
Safeguarding LLMs via Model-Agnostic Latent Safety Signals from Dark Knowledge
AI 摘要
该论文提出 LADE(Latent Safety Signals for Defense),一种从大语言模型首词输出概率分布中提取潜在安全信号的防御方法,旨在解决现有解码阶段防御在提升安全性时导致过度拒绝、以及依赖特定架构内部隐藏状态而缺乏通用性的问题。LADE 的核心洞察是,除了表面的拒绝令牌外,首词分布中的暗知识(即超出 argmax 的信息)包含区分有害与良性查询的潜在安全信号,这些信号在不同 LLM 间具有一致性,形成源自安全对齐的模型无关方向。
LADE 由三个组件构成:首先从暗知识中提取潜在安全信号,选择首词概率分布中前 k 个最具安全判别力的令牌;其次通过分词器映射将这些令牌跨不同分词器进行转换,实现模型无关应用;最后基于 kNN 搜索对映射后的令牌进行分类以判别查询意图。实验显示,LADE 在多种 LLM 和基准测试中能有效抵御广泛的越狱攻击,降低攻击成功率的同时保持了具有竞争力的安全 - 效用权衡。
事实层面,该方法仅依赖首词输出概率分布,不访问内部隐藏状态,理论上可应用于任何架构的模型。推断层面,这种基于暗知识的特征提取可能成为未来轻量级、通用安全防御的标准范式,减少对特定模型微调或内部状态的依赖。猜测层面,其实际部署效果是否受限于特定分词器的映射精度,以及在极端对抗样本下的鲁棒性仍需更多工业界实测验证。
来源:arXiv cs.CR · arxiv.org