跳到正文
原文
arXiv cs.CR· Toluwani Aremu, Samuele Poppi, Nils Lukas·· 6 小时前AI 评分68

Constitution-Guided Watermarking 提出用自然语言原则动态调整大模型水印配置

Constitution-Guided Watermarking

AI 摘要

这篇论文提出了名为 Constitution-Guided Watermarking 的框架,旨在解决现有文本水印技术中强信号会损害文本质量、而抗编辑设计可能助长伪造的固有矛盾。该框架不再强制所有请求使用统一的固定配置,而是允许根据提供者列出的自然语言原则(constitutional rules)动态选择适合特定请求的权衡方案。

在架构实现上,系统包含两个核心组件:离线阶段由一个预训练的推理智能体(reasoning agent)审查宪法规则与水印实现,利用实证反馈迭代优化规则特定的配置;部署阶段则由独立的监控器识别适用规则并检索对应策略(包括豁免条款),且不修改正在服务的模型本身。这种设计支持基于不断演变的提供者需求进行离线并行优化,并将每个部署的配置与其评估证据绑定,确保决策可审计。在概念验证评估中,结合 KGW 和五条规则的宪法,该框架在优先鲁棒性的请求上将重述后的检测率提高了最多 14 个百分点,同时在聚合质量和清洁检测方面匹配或超过了所有基线,且保持 0.1% 的假阳性率。

事实层面,该研究展示了通过引入外部推理机制来解耦水印配置与模型服务的可能性,证明了动态策略优于静态策略在特定指标上的表现。推断层面,这种“规则驱动”的水印管理方式可能成为未来大模型提供商应对复杂合规与安全需求的标准化基础设施,特别是当不同客户对内容溯源和生成质量的敏感度存在显著差异时。猜测层面,虽然论文强调了离线优化的灵活性,但实际部署中监控器实时解析自然语言规则并映射到具体参数配置的延迟开销,以及对抗性攻击者针对这套动态规则系统的逆向工程难度,仍需进一步观察。

来源:arXiv cs.CR · arxiv.org