跳到正文
原文
arXiv cs.CR· Domenic Rosati, Alessa Carbo, Ali Dadsetan, Hong Huang, Matthew Young, Subhabrata Majumdar, Frank Rudzicz, Hassan Sajjad·· 6 小时前AI 评分75

移除信息内容不能认证开放权重模型的防篡改能力

Removing Information Content Does Not Certify Tamper Resistance in Open-Weight Models

AI 摘要

该论文指出仅凭发布时的互信息(mutual information)无法普遍认证开放权重模型对微调攻击的抵抗能力。研究发现,保持功能不变的参数化重定义可以在不改变信息量的情况下改变梯度下降几何结构,因此任何不变证书都受限于最快的可达参数化路径。

作者通过显式构造展示了即使训练数据过滤下的权重 - 数据互信息和能力移除下的标签 - 表示互信息均为零,模型仍可在一次梯度步内恢复。控制实验进一步表明,恢复时间取决于训练顺序,而攻击速度受参数化方式影响,精确的表示级独立性甚至能保留整个参数雅可比矩阵。

事实层面,论文证明了现有基于信息量的认证方法存在根本缺陷;推断层面,这意味着单纯依赖“移除有害信息”作为安全手段是不够的;猜测层面,未来的认证标准必须引入对攻击动力学的约束,而不仅仅是静态的信息度量。

来源:arXiv cs.CR · arxiv.org