跳到正文
热点事件持续更新

ASCENT:通过一阶最优微调实现安全与效用协同增强

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026年10月7日,arXiv发布论文介绍ASCENT框架。该研究针对监督微调中安全与效用难以兼顾的问题,提出利用一阶最优的安全感知周期性校准和任务优化方法。实验表明,在多个大语言模型家族及下游任务中,ASCENT将下游效用最高提升20.3%,同时将攻击成功率降低35.5%。其核心机制是将安全建模为模型参数的函数,并基于一阶近似刻画参数更新下的安全变化,从而在固定秩和Frobenius范数约束下实现两者的协同增强,在所有评估设置下均达到最先进水平。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.CR
    ASCENT 通过一阶最优微调与重校准实现安全与效用协同增强

    该论文提出 ASCENT 框架,旨在解决监督微调(SFT)中安全与效用难以兼顾的问题,通过一阶最优的安全感知周期性校准和任务优化实现两者的协同增强。实验显示,在多个 LLM 家族和下游任务中,该方法可将下游效用最高提升 20.3%,同时将攻击成功率降低 35.5%,在所有评估设置下均达到最先进水平。 核心机制在于将安全建模为 LLM 参数 S(θ) 的函数,并利用其一阶近似来刻画参数更新下的安全变化。在固定秩和 Frobenius 范数预算下,作者证明由安全函数梯度的前 r 个奇异分量构成的更新能最大化估计的安全变化,用于周期性校准以保存并提升安全性。同时,推导出了唯一的保安全任务更新,使其在接近原始任务更新的同时惩罚对估计安全变化的负面影响,两者交替进行以实现双重目标。 事实层面,该研究基于 arXiv cs.CR 发布,代码已开源;推断层面,这种基于梯度的动态校准可能优于依赖静态安全子空间的方法,解决了后者在微调过程中可能过时的缺陷;猜测层面,该方法在极端对抗场景或长周期持续学习中的表现仍需进一步验证,目前仅展示了多模型家族的基准测试结果。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。