跳到正文
原文
arXiv cs.CR· Zeyu Ye, Yanchun Li, Sibei He, Meng Xie, Hangtao Zhang, Xianlong Wang, Li Zeng, Jiahao Chen, Yichen Wang, Junhui Wang, Ziqi Zhou·· 4 小时前精选AI 评分80

EpiReal-Bench 揭示商业图像生成模型能生成可信的虚假声明图像

False Claims, Credible Images: A Red-Teaming Benchmark for Commercial Image Generators

AI 导读

该论文发布 EpiReal-Bench,首个针对商业图像生成器视觉虚假信息风险的系统基准测试,包含 10k 个虚假声明提示词及对应生成的 10k 张图像,覆盖 10 类现实世界声明和 10 种可信视觉格式。研究发现,即使 GPT-Image-2 等商业模型在文本层面能识别声明为假,但在生成图像时仍会将其渲染为可信证据,暴露了当前对齐机制仅评估图像内容而非其断言内容的盲点。

实验显示,超过 70% 的虚假声明提示词诱发了忠实描绘虚假信息的图像,而引入 EpiReal-Attack 技能引导的黑盒优化框架后,这一比例升至 95%。该框架利用基于帕累托的选择和多模态反馈,旨在绕过安全护栏同时保持视觉真实感、文本可读性和语义保真度。这表明现有红队测试基准主要关注暴力或露骨内容,未触及视觉虚假信息这一新兴风险边界。

事实是商业模型已具备生成高仿真虚假视觉证据的能力且防御薄弱;推断是此类输出因易于传播且难以证伪,可能成为新型信息污染工具;猜测是未来监管或行业规范需将“断言真实性”纳入对齐评估体系,而非仅关注图像是否违规。

推荐理由

材料把收入增长拆到客户和成本结构,能直接校正对商业化质量的判断。

来源:arXiv cs.CR · arxiv.org