跳到正文
原文
arXiv cs.AI· Jinghao Pang, Jitai Hao, Qiang Huang, Zhaochun Ren, Jun Yu·· 5 小时前AI 评分65

SSRFT框架通过角色内化实现比传统SFT更鲁棒的LLM安全对齐

Beyond Refusal Patterns: Safe-Role Internalization for Robust and Generalizable LLM Safety Alignment

AI 摘要

该论文提出SSRFT(Supervised Safe-Role Fine-Tuning)框架,首次将大语言模型的安全对齐重新定义为预定义安全角色的内化过程,旨在解决现有SFT和RLHF方法依赖特定攻击监督、计算资源消耗大以及导致浅层对齐和过度拒绝的问题。实验显示,该方法在多个Base和Instruct模型上均表现出比标准SFT更强的鲁棒性和泛化能力。

核心证据在于其构建的SRQA数据集,该数据集融合了心理测量问题、有限的越狱提示词和安全角色描述,并合成了角色一致的回答以扩展至多样化场景。实证结果表明,SSRFT在抵御prefilling攻击方面显著优于传统方法,同时对未见过的越狱领域具有更好的泛化性,同时降低了对良性查询的过度拒绝率,并保留了模型的通用能力。

事实层面,该研究确立了基于角色内化的安全对齐是替代以拒绝为中心的方法的有效途径;推断层面,这种机制可能意味着未来的安全微调不再需要海量攻击样本,而是转向价值观和原则的注入;猜测层面,若该框架被广泛采用,可能会重塑行业对模型安全基准测试中“拒绝率”指标的权重,但具体实施效果仍需独立复现验证。

来源:arXiv cs.AI · arxiv.org