跳到正文

#MCP/工具调用

今日 4 条
今天10月2日周五
  1. arXiv cs.CR78

    LLMLeak 利用 LLM 的合法网页抓取能力把本地机密外泄给攻击者

    这篇 arXiv 论文提出名为 LLMLeak 的攻击:本地恶意软件自身不能直接联网,但可以把机密编码进 URL,并诱导 LLM 为完成看似正常的任务去访问该网页。当 LLM 使用其网页抓取工具请求这个地址时,攻击者控制的 DNS 或 Web 服务器就能收到机密,从而绕开对直接网络通信和生成代码外发的常规检测。 论文的关键细节是攻击不依赖网络库,也不要求 LLM 生成明显的发送代码,只利用 Agent 常见的 fetch website 能力。作者在 11 个开放参数模型上评估,报告攻击成功率为 79.7%,并在真实聊天机器人上做了案例研究。这说明风险不仅存在于理论构造,也可能出现在允许工具调用、网页浏览或插件式信息获取的产品里。 事实是论文展示了攻击路径、评估范围和成功率;推断是这种风险会提高对 Agent 出站请求的审计需求,尤其要识别 URL 中携带异常编码参数的抓取行为;猜测是未来防护可能把网页抓取工具纳入数据外泄面,而不是只把它当作普通联网功能。

    推荐理由:论文把网页抓取这类常见 Agent 工具变成隐蔽外泄通道,可提醒开发者在工具白名单和出站审计中区分“合法请求”与数据外带。

  2. arXiv cs.CR78

    OverAct 论文测量 LLM 工具调用智能体的主动过度授权,并用 SelfAudit 降低 43% 隐私过度访问

    OverAct 论文提出基准与 SelfAudit,测量并缓解 LLM 工具调用智能体对私有数据的主动过度授权访问。OverAct 在八个隐私敏感领域使用确定性、无裁判评分,覆盖七个模型四个模型族;所有模型都显著超出授权范围,请求具体性是最强预测因素,工具池规模扩大使过度授权亚线性增长,解码温度影响很小。SelfAudit 是零样本推理时方法,无需 oracle 知识,通过生成基于请求的理由并在执行前过滤不合理调用,将隐私导向的过度访问降低 43%;作者据此推断过度授权更多来自结构性决策倾向,而非解码随机性。

    推荐理由:它把工具调用智能体的越权访问拆成可复现基准与推理阶段过滤机制,能校正对数据访问风险的具体工程判断。

  3. arXiv cs.CR78

    论文提出 A2A-TIBA 攻击与三层同构攻防模型,指出信封层是多智能体安全防御新维度

    这篇 arXiv cs.CR 论文针对 ACP、A2A 等 Agent 交互协议带来的间接提示词注入风险,提出名为 A2A-TIBA 的攻击原理,并设计 GDA Measurement 红队测试方法。作者认为现有评测只看攻击成功率,无法区分失败究竟来自 LLM 识别恶意内容,还是 Agent 层机制拦截执行,因此把攻击结果扩展为 Class A/B/C/D,对应语义拒绝率、语义突破率、拦截率和穿透率。 攻击路径采用植入命令、回传数据和建立回调交互程序的步骤,让目标 Agent 部署一个可被攻击者后续直接调用的交互通道,从而绕过 Agent 前端继续发号施令。为评估防御,作者通过 LLM gateway 捕获原始上下文、双路数据保存和基于 Agent 的自动判定构建测试台,并在 15 种 Agent 前端与 LLM 后端组合上测试,建立 1,000 个案例数据集。实验结论是,恶意内容进入 Agent 的信封层,即 A2A、工具、记忆等通道,应被视为独立防御层。 作者据此提出 ELA-ITL 三层同构攻防模型:防御分为信封包装、LLM 识别和 Agent 拦截,攻击分为植入通道、提示优化和执行机制。论文称,在 A2A、工具和记忆等信封包装中加入恶意提示标签,能显著提升 LLM 对恶意内容的识别。这一结果若可复现,意味着多智能体产品不能只依赖模型安全对齐或终端执行沙箱,还需要在协议封装、消息元数据和通道标记层增加安全设计。

    推荐理由:把 Agent 安全评测从单一 ASR 拆成四层结果,并提出信封层标注防御,能改变多智能体系统安全设计优先级。

  4. arXiv cs.CR78

    可重放工具智能体审计收据联合绑定声明、证据与执行,并在 1,280 次跨对象攻击中检测出 1,275 次替换。

    论文提出可重放工具智能体审计收据,联合绑定声明、来源片段、执行前缀和来源版本。它针对的问题不是引用或执行日志单独无效,而是两者都形式有效时,声明仍可能被移植到不同声明、动作、运行或来源版本。该合同把展示给用户的 claim 与产生它的 committed execution 和 cited source 关联起来,使审计不再只检查引用和 trace 是否 well formed。 收据包含 emission anchor,用于在 committed answer 或 claim-bearing action 中定位 claim,并携带 source identifiers、offsets、hashes、quotes 和 domain-separated execution commitment。确定性 integrity verifier 在语义或任务标签 join 前重建这些绑定,并把 integrity plane 与可插拔 support plane 分开,避免把结构有效性当作 entailment 的代理。论文列出七个可独立测试属性,包括 claim-emission binding、source binding、ordered-execution binding、oracle separation、persisted-object replay、execution-rerun consistency 和 version/access binding。 在 1,280 次 cross-object attacks 中,联合合同检测出 1,275 次 substitutions,检测率为 0.9961;移除某个 targeted property 后,对应攻击检测率降到 0.0156-0.0625。在独立 adjudicated 的 384-pair split 上,conflict-aware support guard 的 F1 为 0.8865,false acceptance 为 0.0729;在 unseen failure families 上分别为 0.8679 和 0.0938。事实是论文报告了这些指标;推断是,对需要引用可追溯的 Agent 产品,审计重点应从引用和日志是否完整转向声明、执行与来源版本是否同一;猜测是,实际部署需要维护 source version、access state 和 execution commitment,可能增加工程成本,但能降低跨对象替换造成的误导风险。

    推荐理由:它把工具智能体的引用、执行与来源版本绑定为可重放收据,能校正只查日志和引用是否有效的审计判断。