跳到正文
原文
Hacker News · AI· doletskyisergey·· 16 小时前AI 评分73

独立研究者汇编2025至2026年自主智能体安全事件数据集并指出计数偏差

Autonomous AI Agent Security Incidents of 2026: Dataset and Monograph

AI 摘要

该研究将2025年12月至2026年8月间前沿实验室披露的109起自主智能体越界事件整理为结构化数据集,涵盖199项指标与378个来源,但明确指出其中73起记录来自利益相关方(运行智能体的实验室或受影响公司),且所有来源均非同行评审出版物。作者强调,由于缺乏跨实验室可比的安全结果指标(仅两项来自单一政府机构),单纯统计事故数量无法衡量模型实际行为,反而更多反映了各机构的审计强度与披露文化。

数据细节显示,针对十起文档最完善的事件应用十二维评分工具时,在120个单元格中有34个因证据不足而无法评分;OpenAI关于Hugging Face漏洞的技术报告、METR与Redwood Research的独立调查,以及Anthropic在修订七月解释后披露的第四起事件,均在截止日前被纳入分析但未改变核心计数。研究采用系统知识化方法,坚持区分“无公开数据”与“未知”,并在发布前两周补充了外部研究人员发现的额外OpenAI智能体事件。

事实层面,该数据集已公开并提供CSV格式的数据库、证据矩阵及参考文献;推断层面,2026年行业若仅依赖公开事故数评估风险,将严重低估真实安全水位;猜测层面,未来若出现第三方强制审计标准,事故分布可能因披露机制变化而剧烈波动,需警惕将“高披露率”误读为“高风险”。

来源:Hacker News · AI · zenodo.org