跳到正文
热点事件持续更新

提出语义行为水印以增强LLM Agent抗篡改能力

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026年10月7日,研究者在arXiv发布论文《Semantic Behavioral Watermarking》,针对现有LLM Agent水印方案缺陷提出新方案。报道指出旧方案存在两大问题:一是绑定具体动作符号导致工具重命名即失效;二是无法防御对手伪造验证通过他人身份的轨迹。作者提出的语义行为水印(SBW)通过在历史条件下对语义动作簇进行水印嵌入,并将公共簇桶替换为带密钥的抗碰撞分桶,使新桶分配在随机预言机模型下不可预测。实验显示,在ToolBench基准上,面对改写攻击时,SBW在5个不同厂商的3B-14B模型上的检测率为0.49至0.66,而旧方案仅0.05至0.12。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.CR精选
    Semantic Behavioral Watermarking提出基于语义动作簇的Agent水印以抵抗改写与伪造

    该论文指出当前LLM Agent的水印方案存在两大缺陷:一是绑定具体动作符号导致工具重命名即失效,二是无法防御对手伪造验证通过他人身份的轨迹。作者提出语义行为水印(SBW),通过在历史条件下对语义动作簇进行水印嵌入,并将公共簇桶替换为带密钥的抗碰撞分桶,使新桶分配在随机预言机模型下不可预测。 实验显示,在ToolBench基准上,面对改写攻击时,SBW在5个不同厂商的3B-14B模型上的检测率为0.49至0.66,而旧方案仅0.05至0.17;在ALFWorld基准上,SBW检测率高达0.92至0.97,旧方案接近零。此外,带密钥的分桶将自适应伪造成功率从100%降至误报基线水平。但论文也明确划定了保障边界:当对手复制受害者自身步骤并进行乱序拼接时,SBW可完全中和(Qwen2.5-3B上为0.000),然而链式回放(chained replay)的攻击成功率仍维持在0.76至0.98之间,被报告为未解决开放问题。 事实层面,SBW通过牺牲约一半的单步水印容量换取了改写鲁棒性。推断层面,这意味着Agent系统的溯源能力需从依赖精确动作序列转向依赖语义意图,但针对链式复放的防御仍是当前技术盲区。猜测层面,未来若出现更复杂的组合攻击,现有的语义聚类方法可能面临新的对抗样本挑战。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。