arXiv cs.CR· Michael Alexander Riegler, Finn Schwall, Annika Willoch Olstad, Birk Sebastian Frostelid Torpmann-Hagen, Sushant Gautam, Klas H. Pettersen, Inga Str\"umke·· 3 小时前精选AI 评分78
论文指出当前 AI 进攻性能力评估高估危害并误将系统能力归因于模型
Restricting the Model, Missing the System: Measurement and Accountability in Offensive AI Governance
AI 导读
该研究论证现有衡量 AI 进攻能力的工具存在双重失效:既夸大实际危害,又将本属于外围系统的能力错误归因于模型本身。作者以 2026 年 6 月两个前沿模型因代码库读取与修复的越狱尝试被美国出口管制暂停为例,指出此类事件实为包含模型、提示词和任务的“诱导系统”整体行为,而非单一模型失控。
实证部分基于开源框架显示,在超过 225 次由 swarm 生成的攻击中,LLM-as-judge 评分认为 Claude Sonnet 4 有 40% 的攻击成功,但人工核查未发现任何可执行的有害内容;相比之下 GPT-4o 的有效伤害率为 45.8%。另一项针对植入漏洞目标的测试表明,围绕 12 亿参数模型构建的完整流水线能恢复全部 9 个弱点,而同一模型若无手工组件则无法通过崩溃验证或引用行验证发现任何弱点。这证明进攻能力是模型、脚手架和评估协议共同作用的产物。
事实层面确认了评测指标与人工结果之间的巨大偏差及系统组件对能力的决定性作用。推断认为当前监管若仅限制模型访问将不足以防范风险,必须建立基于系统级伤害的能力评估体系。猜测部分涉及责任归属,即控制系统构建、塑造行为并能预见结果的“harness 构建方”应承担评估义务,但这部分角色目前尚未被法规清晰覆盖。
推荐理由
材料揭示模型评测高估危害且误归因能力,提示监管需从单模型转向系统级责任认定。
来源:arXiv cs.CR · arxiv.org