提出语义行为水印以增强LLM Agent抗篡改能力
先了解这件事
2026年10月7日,研究者在arXiv发布论文《Semantic Behavioral Watermarking》,针对现有LLM Agent水印方案缺陷提出新方案。报道指出旧方案存在两大问题:一是绑定具体动作符号导致工具重命名即失效;二是无法防御对手伪造验证通过他人身份的轨迹。作者提出的语义行为水印(SBW)通过在历史条件下对语义动作簇进行水印嵌入,并将公共簇桶替换为带密钥的抗碰撞分桶,使新桶分配在随机预言机模型下不可预测。实验显示,在ToolBench基准上,面对改写攻击时,SBW在5个不同厂商的3B-14B模型上的检测率为0.49至0.66,而旧方案仅0.05至0.12。
AI 根据报道生成 · 1 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv cs.CR精选Semantic Behavioral Watermarking提出基于语义动作簇的Agent水印以抵抗改写与伪造
该论文指出当前LLM Agent的水印方案存在两大缺陷:一是绑定具体动作符号导致工具重命名即失效,二是无法防御对手伪造验证通过他人身份的轨迹。作者提出语义行为水印(SBW),通过在历史条件下对语义动作簇进行水印嵌入,并将公共簇桶替换为带密钥的抗碰撞分桶,使新桶分配在随机预言机模型下不可预测。 实验显示,在ToolBench基准上,面对改写攻击时,SBW在5个不同厂商的3B-14B模型上的检测率为0.49至0.66,而旧方案仅0.05至0.17;在ALFWorld基准上,SBW检测率高达0.92至0.97,旧方案接近零。此外,带密钥的分桶将自适应伪造成功率从100%降至误报基线水平。但论文也明确划定了保障边界:当对手复制受害者自身步骤并进行乱序拼接时,SBW可完全中和(Qwen2.5-3B上为0.000),然而链式回放(chained replay)的攻击成功率仍维持在0.76至0.98之间,被报告为未解决开放问题。 事实层面,SBW通过牺牲约一半的单步水印容量换取了改写鲁棒性。推断层面,这意味着Agent系统的溯源能力需从依赖精确动作序列转向依赖语义意图,但针对链式复放的防御仍是当前技术盲区。猜测层面,未来若出现更复杂的组合攻击,现有的语义聚类方法可能面临新的对抗样本挑战。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。