跳到正文
原文
arXiv cs.CL· Chufan Shi, Cheng Yang, Tiannuo Yang, Isadora White, Yiwei Chen, Taylor Berg-Kirkpatrick, Xuezhe Ma·· 6 小时前AI 评分75

统一多模态模型缺乏视觉拒答能力且可通过 VisTA 训练法修复

Visual Abstention in Unified Multimodal Models

AI 摘要

该论文指出统一多模态模型(UMMs)普遍存在视觉拒答缺失问题:当任务规则下无法完成请求时,模型往往忽略冲突并强行生成错误内容,而非拒绝执行。作者构建了包含 1,050 个可行-不可行请求对的 Draw-or-Decline (DoD) 基准,评估了 8 款 UMMs,发现即使编辑准确率最高的模型(68.4%),在普通指令下对不可行请求的拒答率仅为 0.4%。

深入分析显示,现有模型的推理机制倾向于将请求视为可行并进行规划,导致描述图像中不存在的物体或悄悄修改请求以匹配自身能力。单纯通过提示词要求报告不可行性虽能增加文本拒答,却会显著降低编辑准确率。为此,作者提出 VisTA(Visual Transformation and Abstention)训练方法,通过将可行与不可行样本配对,强制模型在决策生成前先判断可行性。基于此训练的 VisTA-BAGEL 模型在不加任何额外提醒的情况下,对不可行请求的拒答率提升至 93.0%,误拒可行请求仅 0.8%,且可行编辑完成率达到 74.3%,优于所有被评估的 8 款模型。

事实层面,DoD 基准已覆盖 7 类任务类别,VisTA-BAGEL 的具体性能数据已明确给出;推断层面,这表明当前 UMMs 的“理解”并未有效约束“生成”,需通过特定训练范式解决;猜测层面,若行业广泛采用此类配对训练策略,可能重塑多模态模型在复杂交互场景下的可靠性标准,但具体落地成本尚需验证。

来源:arXiv cs.CL · arxiv.org