arXiv cs.AI· NaHyeon Park, Minhyun Lee, Hyunjung Shim·· 4 小时前AI 评分65
CALM 论文揭示文本生成图像中全局去毒存在覆盖与选择的固有矛盾
Keep It CALM: Analyzing the Limits of Global Unsafety in Text-to-Image Generation
AI 摘要
该研究通过几何分析指出,当前无需训练的文本生成图像安全机制依赖可复用的全局不安全信号(如不安全方向或毒性子空间),但这种全局假设存在一致的覆盖 - 选择权衡:紧凑的不安全子空间无法覆盖异构的不安全语义,而更广泛的聚合则会扭曲与安全相邻的良性提示词。
针对这一发现,作者提出 CALM(Counterfactual Adaptive Local Modulation),一种无需训练的防护方法,用提示词局部的反事实修正替代均匀的全局移除。该方法利用匹配的不安全 - 良性锚点,将每个提示词路由到活跃的不安全类别,仅对违反规则的 token 表示进行最小化编辑以朝向安全侧,并抑制正向对齐的不安全残差分量。评估显示,CALM 在显著改善不安全内容抑制的同时,保留了良性效用。
事实层面,该工作证明了局部反事实修正比全局不安全信号移除更具选择性;推断层面,这意味着未来端侧或轻量级部署的安全层可能从“一刀切”的全局过滤转向基于提示词的动态微调;猜测层面,若行业广泛采纳此类局部修正策略,可能会改变现有大模型厂商对安全对齐模块的架构设计,但具体落地效果仍需验证其在复杂对抗样本下的表现。
来源:arXiv cs.AI · arxiv.org