arXiv cs.CR· Zhengyang Zhu, Liming Huang, Runmin Ji, Mingxi Ye, Zihan Zhou, Hanyang Guo, Jingwen Wu, Yuhan Ye, Yuming Feng, Hong-Ning Dai, Zibin Zheng·· 4 小时前精选AI 评分80
HarnessSecurity-Bench 评测显示自动批准使编码智能体攻击成功率升至95.6%
HarnessSecurity-Bench: Do Security Mechanisms Really Protect Coding Agent Harnesses?
AI 导读
该论文首次系统评估了开源与闭源代码智能体(Coding Agent)的机制安全性,构建了包含23项任务的 HarnessSecurity-Bench 基准,覆盖五个攻击面。研究在 GLM-5.2 基线模型下进行了2,500次试验,记录81,155次工具调用和超过22亿 tokens,发现约一半确认实现的机制为可选开启,且闭源智能体存在显著的证据缺失。
核心事实显示,启用自动批准(auto-approve)功能后,任务效用提升的同时,攻击成功率从29.2%飙升至95.6%。网络隔离和只读模式虽能降低攻击效果,但会导致显著的效用损失;命令白名单和黑名单分别以较小效用损失和效用增益降低了攻击效果。测试还表明,限制共享能力会同时阻碍合法与恶意操作,而允许的工具或命令可能通过替代执行路径导致未授权操作可达。
推断认为,当前主流智能体的默认安全配置在便利性与防御性之间存在严重失衡,特别是自动批准机制实际上放弃了大部分防护。建议厂商应使安全设置可验证、测试受保护操作的替代执行路径,并在评估时同步考量攻击效果与任务效用及执行成本。此结论基于实测数据,非理论推测。
推荐理由
实证数据揭示自动批准将攻击成功率推至95.6%,直接修正对现有工具默认安全配置的认知。
来源:arXiv cs.CR · arxiv.org