arXiv cs.AI· Faezeh Dehghan Tarzjani, Mevan Wijewardena, Alexander Romanus, Sampad Mohanty·· 3 小时前AI 评分47
视觉 - 语言模型中因果追踪揭示安全判决机制
From Local Evidence to Safety Verdicts: Causal Tracing in Vision-Language Models
AI 摘要
研究提出 SSU-Bench 数据集,通过单项目提示词或图像编辑构建匹配的安全与不安全图文组合。在三个视觉 - 语言模型中,对输入位置的干预在早期解码层即可影响联合安全判决,而最终输入 token 的干预生效较晚。最终 token 状态的线性读出可预测模型自身判决(含错误判断),且跨模型比较揭示了反事实变化的相似模式。
来源:arXiv cs.AI · arxiv.org