跳到正文
原文
arXiv cs.CR· Alexi Canesse, Mathis Le Bail, Ma\"el Jenny, Cl\'ement Elliker, Mahammed El Sharkawy, Sonia Vanier·· 6 小时前AI 评分72

PatchBench 论文指出模型安全补丁可能通过基准测试却造成局部良性行为抑制

PatchBench: Measuring Collateral Damage in Activation Patching

AI 摘要

该研究提出 PatchBench 基准与 PatchBench-Local 协议,旨在解决现有安全评估无法区分选择性修复与广泛性局部抑制的问题。作者从 37 个公开数据集中筛选出 15,314 条英文提示词,经 WildGuard 过滤、Elo 排名及人工验证后,构建包含 400 个高置信度越狱失败案例的银行。针对每个有害源提示词,协议生成三类局部邻居:保留恶意意图的有害变体、结构匹配的良性提示词以及复用关键有害术语的良性提示词,以此分别评估有害修正与良性保留。

在评估四种激活引导(activation steering)方法时,研究发现全局能力指标(如 MMLU)几乎保持不变,但局部良性回归却十分严重。这证实了仅依赖攻击成功率或拒绝率等聚合指标会遗漏重要的附带损害(collateral damage),即模型可能在阻断特定越狱的同时,过度拒绝共享相同措辞或结构的良性请求。这种“误伤”现象在越狱修复中尤为突出,因为修复目标本应是纠正特定不安全行为而不改变无关行为。

事实层面,该工作已提交至 NeurIPS 2026 数据集与基准赛道,并提供了基于实证观察的模型特定越狱失败案例库。推断层面,这意味着当前主流的激活修复技术若缺乏局部精度评估,其商业化部署存在隐性风险,可能导致用户体验下降而非真正的安全提升。猜测层面,未来行业可能会将 PatchBench-Local 纳入安全对齐的标准流程,以替代或补充现有的全局基准测试。

来源:arXiv cs.CR · arxiv.org