跳到正文
热点事件持续更新

ReSI 框架通过递归评估提升 AI 安全对齐

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026 年 10 月 9 日,arXiv 发布论文介绍 ReSI(Recursive Safety Improvement)框架。该框架旨在解决 AI 系统递归自改进时的安全对齐挑战。其流程包括在每轮迭代中应用多样化红队测试识别漏洞、开发训练配方,并在保留能力的帕累托门控筛选后,选择安全增益最大的版本作为下一轮目标模型。实验显示,ReSI 在四个密集型和混合专家模型上表现优异,其在分布内和分布外安全基准上的表现匹配。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv cs.CR
    ReSI 框架通过递归评估与更新实现模型对已知威胁的抵抗和对未知风险的韧性

    该论文提出 ReSI(Recursive Safety Improvement)框架,旨在解决 AI 系统通过递归自改进提升自身能力时面临的安全对齐挑战。ReSI 通过自动化研究流程,在每一轮迭代中应用多样化的红队测试方法识别当前目标模型的漏洞,开发训练配方,并在保留能力的帕累托门控筛选后,选择安全增益最大的版本作为下一轮的目标模型。 实验数据显示,ReSI 在四个密集型和混合专家模型上表现优异,其在分布内和分布外安全基准上的表现匹配或超越了前沿模型,且在几乎所有安全评估中优于对齐基线,同时大幅保留了通用能力。关键指标显示,ReSI 将四个模型的平均 X-Teaming 攻击成功率从 86.01% 降低至 31.45%,这一结果远低于 GPT-5.6-Luna 所达到的 56.69% 的前沿水平,表明该框架在面对训练期间未见过的攻击时具有更强的韧性。 事实层面,ReSI 确实实现了上述攻击成功率的显著下降并通过了帕累托筛选;推断层面,这种递归机制可能成为未来模型持续演进中维持安全性的标准范式;猜测层面,该方法是否能在更广泛的非特定领域或极端对抗场景下保持同等效果仍需进一步观察。材料未提及具体的计算资源消耗或训练成本细节。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。