跳到正文
原文
arXiv cs.CR· Georgios Milis, Tom Sander, Tom\'a\v{s} Sou\v{c}ek, Heng Huang, Pierre Fernandez·· 5 小时前AI 评分68

LLM 水印检测公开化风险与拆分密钥防御机制研究

Could LLM Watermark Detection be Public?

AI 摘要

该论文量化评估了公开 LLM 水印检测器在不同访问权限下的额外风险,并提出一种拆分密钥(split-key)的水印方法,将部分密钥暴露给公共检测器,保留另一部分用于完整验证和取证。研究发现,知情攻击者仅能移动公开信号,导致公开与私有分数失衡,而统计测试结合双阶段机制可有效识别此类篡改。实验表明,公开检测仅在编辑预算较小时提升移除难度,因为简单改写即可在低质量成本下剥离水印,但同时也使伪造成为可能,而私有流程能识别这些伪造行为。

核心证据在于:公开半密钥虽允许攻击者调整公开信号,却制造了公开与私有分数的不可调和失衡;这种失衡通过统计检验被捕捉,并与全密钥判决结合形成双重防线。材料未提及具体模型名称、参数量或部署场景,仅基于理论建模与模拟攻击进行评估。

事实层面,论文证明了公开检测器并非绝对有害,而是改变了攻击者的能力边界;推断层面,该机制可能降低提供商责任并推动互操作性;猜测层面,实际工业落地需解决实时性与误报率问题,但原文未涉及工程实现细节。

来源:arXiv cs.CR · arxiv.org