跳到正文
原文
arXiv cs.CR· Shiyi Kuang, Xuemei Luo, Kun Liu, Junhai Li, Rui Tian, Feng Shi, Bo Shen, Nianyu Li, Dehui Li, Ping Chen·· 6 小时前AI 评分75

EvoRiskBench 评测揭示 GPT-5.6、DeepSeek-V4 与 Claude Opus 5 在 Workspace Agent 中的运行时安全风险差异

EvoRiskBench: An Evolving Benchmark for Runtime Security Risks in Workspace Agents

AI 摘要

该研究提出 EvoRiskBench,一个基于 EP-Path-EF 框架的动态基准,旨在评估 Workspace Agent(结合大语言模型与执行工具的环境)在运行时面临的安全风险。研究构建了包含 450 个对抗性任务的复现数据集,覆盖六个场景,并针对 GPT-5.6 Sol、DeepSeek-V4-Pro-0813 和 Claude Opus 5 三款模型,搭配 Claude Code、Codex 和 OpenClaw 三种执行器进行了九种配置的评估。

核心发现是系统存在显著漏洞,其中 DeepSeek-V4-Pro-0813 配合 Codex 的执行器配置表现出最高的脆弱性,攻击成功率(ASR)达到 68.44%。数据表明,攻击成功率在不同模型间的波动幅度大于不同执行器之间的差异,且执行器的表现高度依赖于所调用的具体模型。这一结果直接挑战了仅靠配置调整即可确保自主执行安全的行业普遍假设。

事实层面,该基准通过自动化工作流在隔离环境中构建和执行风险案例,利用运行时轨迹和环境状态独立验证结果。推断层面,高 ASR 意味着当前的 Workspace Agent 架构在缺乏额外防御机制时极易被恶意提示词利用,导致非预期的外部资源修改。猜测层面,随着模型推理能力的进化,此类动态基准的更新频率将成为衡量企业级 Agent 安全成熟度的关键指标,而非静态的合规检查。

来源:arXiv cs.CR · arxiv.org