跳到正文
原文
arXiv cs.CR· Weiwei Qi, Chongyu Wang, Tianhang Zheng, Zefeng Wu, Zhilin Guo, Xiaojun Jia, Zhongjie Ba, Kui Ren·· 5 小时前AI 评分70

ASCENT 通过一阶最优微调与重校准实现安全与效用协同增强

ASCENT: First-Order Optimal Fine-Tuning with Recalibration for Safety--Utility Co-Enhancement

AI 摘要

该论文提出 ASCENT 框架,旨在解决监督微调(SFT)中安全与效用难以兼顾的问题,通过一阶最优的安全感知周期性校准和任务优化实现两者的协同增强。实验显示,在多个 LLM 家族和下游任务中,该方法可将下游效用最高提升 20.3%,同时将攻击成功率降低 35.5%,在所有评估设置下均达到最先进水平。

核心机制在于将安全建模为 LLM 参数 S(θ) 的函数,并利用其一阶近似来刻画参数更新下的安全变化。在固定秩和 Frobenius 范数预算下,作者证明由安全函数梯度的前 r 个奇异分量构成的更新能最大化估计的安全变化,用于周期性校准以保存并提升安全性。同时,推导出了唯一的保安全任务更新,使其在接近原始任务更新的同时惩罚对估计安全变化的负面影响,两者交替进行以实现双重目标。

事实层面,该研究基于 arXiv cs.CR 发布,代码已开源;推断层面,这种基于梯度的动态校准可能优于依赖静态安全子空间的方法,解决了后者在微调过程中可能过时的缺陷;猜测层面,该方法在极端对抗场景或长周期持续学习中的表现仍需进一步验证,目前仅展示了多模型家族的基准测试结果。

来源:arXiv cs.CR · arxiv.org