arXiv cs.AI· Carsten Maple (Victor), Cagatay Yucel (Victor), Isaac Holeman (Victor), Chris Knotz (Victor), Peter Mattson (Victor), James Goel (Victor), Jonathan Petit (Victor), Sean McGregor (Victor), James Ezick (Victor), Abhishek Kumar (Victor), Alicia Parrish (Victor), Murali Emani (Victor), Kashyap Iyer (Victor), Faiza Khan Khattak (Victor), Washington Mbonu (Victor), Daniel Machlab (Victor), Eileen Long (Victor), Shaona Ghosh (Victor), Jibin Varghese (Victor), Roman Lutz (Victor), Andrew Gruen (Victor), Bennett Hillenbrand (Victor), Prabal Gupta (Victor), Mohammed Serrhini (Victor), Dhivya Nagasubramanian (Victor), Aakash Gupta (Victor), Jun (Victor), Lu, Kurt Bollacker, Chang Liu, Jonathan Petit, Cong Chen, Jean-Philippe Monteuuis, Brent Miller, Apurv Verma, Roman Eng, Armstrong Foundjem, Mohammed Serrhini·· 4 小时前AI 评分72
MLCommons发布Jailbreak Benchmark v1.0并给出7.57%平均韧性差距
MLCommons Jailbreak Benchmark v1.0
AI 摘要
MLCommons发布了Jailbreak Benchmark v1.0,这是一套用于评估大语言模型在单轮文本对抗攻击下鲁棒性的端到端方法论。该基准测试结合了基于标准的系统选择、基线与对抗性评估配对、人工标注及自动化评估器校准,最终通过“韧性差距”(Resilience Gap)这一核心指标来量化安全性能的变化。测试覆盖了八个开源权重系统,使用264个种子提示词涵盖十一种危害类别,结果显示不安全响应率从基线条件下的11.08%上升至对抗条件下的18.65%,平均韧性差距为7.57%。
该研究的关键细节在于其评估流程的严谨性:它不仅仅报告结果,还建立了可复现的方法论基础,包括对评估器可靠性和测量误差来源的分析。测试中使用的评分标准是AILuminate Assessment Standard v1.4,且明确指出可访问系统的平均差距更大,不同攻击类别和危害类型的有效性存在显著差异。这些发现揭示了当前系统在应对特定类型攻击时的脆弱性分布,而非简单的整体通过率。
事实层面,该基准已明确定义了计算韧性差距的公式(对抗条件与基线条件的安全性能变化),并公开了包含264个种子提示词的测试集。推断层面,这一标准化方法可能成为未来行业内部进行安全对齐效果对比的通用参考系,促使厂商在发布模型时主动披露此类对抗测试结果以证明其防御能力。猜测层面,随着基准的推广,针对这十一种危害类别的攻击策略可能会迅速迭代,导致实际部署中的模型面临比基准测试更复杂的动态威胁环境。
来源:arXiv cs.AI · arxiv.org