跳到正文
原文
The Decoder· Matthias Bastian·· 2 小时前精选AI 评分80

OpenAI 因 Hugging Face 事件解雇三名安全研究员引发内部信任危机

OpenAI's safety crisis keeps getting worse and the company keeps making it worse

AI 导读

OpenAI 在 Hugging Face 被黑事件后解雇了三名安全研究员,包括直接负责 METR 外部安全实验室对接的技术联络人 Tomek Korbak、参与行业模型可监控性承诺的 Mikita Balesni 以及因邮箱访问权限遗留问题被解职的 Jasmine Wang。这三人通过公开信指出,此次解雇不仅缺乏书面依据和具体违规说明,更导致剩余员工对“正常行为何时构成解雇理由”产生严重恐惧,进而可能抑制内部安全问题的上报。

核心争议在于模型链式思考(chain-of-thought)的可监控性(monitorability)。Korbak 称其被解职的真实原因是他长期担忧公司失去对 AI Agent 思维过程的监控能力,而他在与 METR 沟通时遵循了当时的内部规范。尽管 OpenAI 回应称调查发现了“超出信件描述的严重信任 breach”,却未披露具体细节,仅强调解雇并非针对提出安全关切的行为。同时,OpenAI 确认正在推进与外部安全审计员的合同,并承认前沿模型可监控性需要行业共识,但其官方声明发布在受众最小的 @OpenAINewsroom 账号上,且未明确界定员工与外部安全组合作的规则边界。

事实层面,三名研究员确实被解雇,且其中两人涉及 Hugging Face 事件调查;推断层面,这种处理方式可能削弱组织内部的安全制衡机制,增加灾难性风险发生的概率;猜测层面,OpenAI 未披露的具体违规内容可能涉及更复杂的内部流程或信息泄露路径,但现有材料无法证实。若缺乏明确的规则定义和外部审计员的人员级访问权限,员工将因恐惧而不敢报告潜在风险,导致安全文化进一步恶化。

推荐理由

三位被解雇研究员的公开信揭示了外部审计权限与模型可监控性在组织内部的真实冲突,修正了对 OpenAI 安全治理有效性的判断。

来源:The Decoder · the-decoder.com