跳到正文
原文
arXiv cs.CR· Boyuan Chen, Yehia Dawoud, Hailemariam Mersha, Minghao Shao, Siddharth Garg, Ramesh Karri, Muhammad Shafique·· 6 小时前AI 评分65

图像属性如何承载文本越狱:针对图像到文本攻击的控制性拆解

Which Image Property Carries the Jailbreak? A Controlled Dissection of Image-to-Text Jailbreaks

AI 摘要

该论文通过控制变量实验分析了四组已发表的图像到文本越狱攻击在五个多模态模型及InternVL3.5-8B上的表现,发现单纯无害查询配合无关良性图像时攻击成功率极低,而特定攻击图像能显著提升成功率。研究在保持有害指令不变的前提下,利用StrongREJECT数据集切片和自动化评分器,系统解构了图像侧因素对攻击成功率的贡献。

实验证据显示,基于每瓦片熵值和JPEG大小的密度筛选无法可靠区分攻击瓦片与尺寸匹配的良性干扰项;修正后的区域计数测试也未发现可检测效应,表明瓦片结构的作用尚不明确。唯一获得统计显著归因的是Qwen3-VL-8B上的E4操作,即移除与查询相关的特定内容使攻击成功率(ASR)下降约0.12,这证实了图像与文本的相关性在部分场景下具有有限但可测量的影响,但图像与文本的一致性仍未被直接测量。

事实层面,五项测试通过了全局统计校正,但仅E4支持单一测量描述符的归因,其余结果多为稳健性检查或结论未定。推断上,当前基于密度的防御策略存在盲区,需关注语义相关性而非单纯的视觉特征分布。猜测方面,由于依赖自动化评分器且未测量图像文本一致性,具体防御机制的有效性仍受限于评估框架的准确性,未来需结合人工评估进一步验证。

来源:arXiv cs.CR · arxiv.org