arXiv cs.CR· Bingjun Luo, Jialin Guo, Tony Wang, Siqi Li·· 11 小时前AI 评分72
UnifiedAttack 评测大尺寸多模态模型在协同有害图文生成中的安全漏洞
UnifiedAttack: Evaluating the Safety of Large Multimodal Models in Synergistic Harmful Image-Text Generation
AI 摘要
UnifiedAttack 是一个针对原生统一多模态模型的安全评测基准,重点不是单模态有害内容,而是文本与图像协同后产生的额外危害增益。论文同时提出一个协同劫持框架,用 In-Context Reskinning 和 Cognitive Planning Injection 验证漏洞:前者通过 few-shot 方式把对抗意图包装进看似良性的虚拟外壳,降低安全过滤敏感度;后者强制模型先进入中性逻辑规划,再利用其保持一致性的倾向诱导后续生成有害多模态内容。
论文称在多种先进架构上,UnifiedAttack 能持续绕过现代对齐机制。这个结果的关键含义是,统一模型的结构性有用性和逻辑连贯性可能被系统性武器化,因此仅靠单模态内容过滤或通用拒答策略不够,安全防御需要进入协同生成任务的逻辑规划层。
事实是论文提出了基准、攻击方法和实验结论;推断是这类攻击对统一多模态产品尤其相关,因为图文同模型生成会减少跨模块审查点;猜测是未来安全评测会增加 logic-aware defenses 和跨模态协同风险指标。
来源:arXiv cs.CR · arxiv.org