跳到正文
热点事件持续更新

DIBench基准揭示GUI移动智能体在欺骗注入下的决策偏移风险

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月7日,arXiv cs.CR论文提出DIBench基准,旨在评估基于图形界面的移动智能体在真实应用环境中的决策完整性风险。研究指出,现有基准多关注执行层面的异常(如任务失败),却忽略了攻击者通过非特权UI内容注入欺骗信息,诱导智能体偏离指令隐含约束(如选择最便宜或评分最高项)而不产生明显执行错误的隐蔽风险。该实验覆盖了7个商业和3个模拟应用、5种任务类型,并构建了包含1,000个干净样本的数据集以验证上述观点。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.CR精选
    DIBench 基准测试显示 GUI 移动智能体在欺骗注入下存在隐蔽的决策偏移风险

    arXiv cs.CR 论文提出 DIBench 基准,专门评估基于图形界面的移动智能体在真实应用环境中面临的决策完整性风险。该研究指出,现有基准主要关注执行层面的异常(如任务失败或劫持率),却忽略了在多候选选择任务中,攻击者可能通过非特权 UI 内容注入欺骗信息,诱导智能体偏离指令隐含约束(如选择最便宜或评分最高项)而不产生任何明显的执行错误。 实验覆盖 7 个商业和 3 个模拟应用、5 种任务类型,构建了包含 1,000 个干净样本和 36,672 个注入样本的数据集。测试结果显示,仅依赖任务完成度的评估方法会高估智能体的可信度:欺骗性注入能引导关键选择并改变早期行动策略,从而推高完成率并制造虚假的安全假象。此外,常见的防御手段如检测机制、图像预处理和提示词提醒,在提升决策完整性方面表现不一致。 事实层面,该基准已提交至 NeurIPS 2026 评估与数据集轨道,包含统一协议和完整性指标。推断层面,当前行业对移动 Agent 的安全评估体系存在盲区,过度依赖“是否完成任务”而非“是否按正确意图完成任务”。猜测层面,若缺乏此类细粒度基准,未来部署在电商、金融等场景的移动 Agent 可能在无感知情况下被诱导做出违背用户利益的选择,且现有防御方案难以系统性解决此问题。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。