跳到正文
原文
arXiv cs.CR· Suxin Ji, Hungtao Wan, Shaoxuan Chen, An Zhang·· 4 小时前精选AI 评分78

Semantic Behavioral Watermarking提出基于语义动作簇的Agent水印以抵抗改写与伪造

Semantic Behavioral Watermarking: Paraphrase-Robust and Forgery-Resistant Provenance for LLM Agents

AI 导读

该论文指出当前LLM Agent的水印方案存在两大缺陷:一是绑定具体动作符号导致工具重命名即失效,二是无法防御对手伪造验证通过他人身份的轨迹。作者提出语义行为水印(SBW),通过在历史条件下对语义动作簇进行水印嵌入,并将公共簇桶替换为带密钥的抗碰撞分桶,使新桶分配在随机预言机模型下不可预测。

实验显示,在ToolBench基准上,面对改写攻击时,SBW在5个不同厂商的3B-14B模型上的检测率为0.49至0.66,而旧方案仅0.05至0.17;在ALFWorld基准上,SBW检测率高达0.92至0.97,旧方案接近零。此外,带密钥的分桶将自适应伪造成功率从100%降至误报基线水平。但论文也明确划定了保障边界:当对手复制受害者自身步骤并进行乱序拼接时,SBW可完全中和(Qwen2.5-3B上为0.000),然而链式回放(chained replay)的攻击成功率仍维持在0.76至0.98之间,被报告为未解决开放问题。

事实层面,SBW通过牺牲约一半的单步水印容量换取了改写鲁棒性。推断层面,这意味着Agent系统的溯源能力需从依赖精确动作序列转向依赖语义意图,但针对链式复放的防御仍是当前技术盲区。猜测层面,未来若出现更复杂的组合攻击,现有的语义聚类方法可能面临新的对抗样本挑战。

推荐理由

揭示现有Agent水印在工具重命名和轨迹伪造下的失效机制,并给出基于语义聚类的改进方案。

来源:arXiv cs.CR · arxiv.org