跳到正文
原文
arXiv cs.CR· William Hackett, Peter Garraghan·· 4 小时前精选AI 评分88

BRANCH 论文提出针对多扫描器 AI 护栏的动态分支树搜索绕过方法

BRANCH: Bypassing Multi-Scanner AI Guardrails

AI 导读

该论文提出 BRANCH 方法,旨在绕过由多个扫描器组成的协作式 AI 护栏系统。研究发现,尽管多扫描器通过共享隐表示(shared latent representations)使传统绕过技术失效,但 BRANCH 利用分支树搜索动态对单个扫描器应用对抗扰动,并基于所有扫描器的整体改进进行优化和策略选择,从而将绕过评估与攻击信号优化解耦。

实验数据显示,BRANCH 在 120 个场景中针对 6 个护栏系统的攻击成功率达到 100%,相比现有技术查询量减少 72%,墙钟时间缩短 4.5 倍,且在绕过过程中保持语义完整性。此外,生成的绕过样本具有强迁移性,能成功应用于 29 个未见过的护栏系统,其中包括 8 个商业黑盒护栏,部分场景下攻击成功率提升至 100% 且无需额外优化。

事实层面,该方法证明了多扫描器架构并非绝对安全,其内部特征共享机制可能成为新的攻击面。推断表明,当前依赖多模型协同检测的安全方案需重新评估其鲁棒性,特别是面对这种动态解耦优化的攻击时。猜测是,未来护栏设计可能需要引入更复杂的异构特征空间或动态隔离机制来应对此类针对性攻击,但这需要更多实证数据支持。

推荐理由

揭示多扫描器防护的共享隐表示漏洞,提供可转移且高效的对抗样本生成方法。

来源:arXiv cs.CR · arxiv.org