arXiv cs.CR· Jingnan Zheng, Dongcheng Zhang, Yi Zhang, Ming Zhang, Qiaosheng Zhang, Youbang Sun, An Zhang, Xiangnan He, Tat-Seng Chua, Xia Hu, Bowen Zhou, Chaochao Lu, Xiang Wang·· 5 小时前AI 评分75
ReSI 框架通过递归评估与更新实现模型对已知威胁的抵抗和对未知风险的韧性
ReSI: Recursive Safety Improvement toward Resistant and Resilient AI
AI 摘要
该论文提出 ReSI(Recursive Safety Improvement)框架,旨在解决 AI 系统通过递归自改进提升自身能力时面临的安全对齐挑战。ReSI 通过自动化研究流程,在每一轮迭代中应用多样化的红队测试方法识别当前目标模型的漏洞,开发训练配方,并在保留能力的帕累托门控筛选后,选择安全增益最大的版本作为下一轮的目标模型。
实验数据显示,ReSI 在四个密集型和混合专家模型上表现优异,其在分布内和分布外安全基准上的表现匹配或超越了前沿模型,且在几乎所有安全评估中优于对齐基线,同时大幅保留了通用能力。关键指标显示,ReSI 将四个模型的平均 X-Teaming 攻击成功率从 86.01% 降低至 31.45%,这一结果远低于 GPT-5.6-Luna 所达到的 56.69% 的前沿水平,表明该框架在面对训练期间未见过的攻击时具有更强的韧性。
事实层面,ReSI 确实实现了上述攻击成功率的显著下降并通过了帕累托筛选;推断层面,这种递归机制可能成为未来模型持续演进中维持安全性的标准范式;猜测层面,该方法是否能在更广泛的非特定领域或极端对抗场景下保持同等效果仍需进一步观察。材料未提及具体的计算资源消耗或训练成本细节。
来源:arXiv cs.CR · arxiv.org