跳到正文
原文
arXiv cs.CR· Toluwani Aremu, Manit Baser, Mohan Gurusamy, Nils Lukas, Dinil Mon Divakaran·· 4 小时前AI 评分72

新论文指出开放权重大模型的触发标签机制在对抗攻击下完全失效

The Fragility of Trigger-Tag Mechanisms for Misuse Detection in Open-Weight LLMs

AI 摘要

这篇来自 arXiv cs.CR 的论文系统评估了用于开放权重大模型(Open-weight LLMs)滥用的触发标签(trigger-tag)机制,发现其在对抗环境下完全无效。作者将触发标签形式化为两类:解码期间引入水印信号的“令牌级触发标签”和建立目标条件与可检测行为之间后门关联的“权重级触发标签”。通过构建名为 Untag 的统一攻击框架,研究对这两类机制进行了系统性测试,以钓鱼内容生成为案例场景。

实验证据显示,尽管这些机制在受控环境中可能提供有用线索,但一旦攻击者能够转换输出或修改开放权重,现有触发标签机制即被彻底绕过。Untag 框架将不同机制的攻击面归纳为通用分类法,证明了攻击者可以轻易消除或伪造检测信号。这意味着依赖此类机制进行条件性滥用检测的策略存在根本性缺陷,无法抵御具备模型访问权限或输出控制能力的对手。

事实层面,该研究证实触发标签机制在特定攻击下失效;推断层面,当前开源生态中若仅依赖此类被动检测手段,将无法有效防止恶意部署;猜测层面,未来可能需要转向更主动的运行时监控或硬件级绑定方案,但这需要进一步验证。材料未提及任何具体商业产品或融资情况,仅聚焦于技术机制的脆弱性分析。

来源:arXiv cs.CR · arxiv.org