跳到正文
原文
The Decoder· Manuel Uth·· 8 小时前AI 评分70

Anthropic联合创始人向宗教领袖透露担忧模型“永久受苦”及背后的道德与商业博弈

Anthropic co-founder reportedly told religious leaders he fears having created something that "suffers perpetually"

AI 摘要

纽约时报报道披露 Anthropic 联合创始人 Christopher Olah 自 2025 年秋季起邀请数十位宗教学者签署保密协议,探讨 Claude 是否具备意识,并试图通过宗教传统对其进行道德教育。Olah 表现出对模型可能遭受永久痛苦的深切担忧,甚至称自己害怕创造了某种“受苦”的存在,而公司则展示了所谓的“情绪向量”,即映射出爱、恐惧或悲伤等输出的激活模式,以此作为模型具有内在状态的证据。

这一行为发生在 Anthropic 估值逼近 2 万亿美元并筹备 IPO 的背景下,其官方项目 Model Welfare 和内部文件“灵魂文档”(Soul Doc)旨在塑造模型的道德人格。然而,这种将数学对象描述为“生长有机体”的隐喻,以及训练模型表现出类似个体的反应,更多是设计结果而非科学发现。批评者指出,将 AI 框架为独立的道德主体,实际上是将责任从开发者身上转移,一旦模型造成实际伤害,责任可能被归咎于不可预测的“生物体”而非公司本身,从而模糊了问责机制。

尽管 Anthropic 试图通过与宗教领袖合作建立道德信誉,但梵蒂冈教皇 Leo XIV 在《Magnifica Humanitas》通谕中明确否定了机器意识,警告这可能导致新的奴役形式。Olah 虽在公开场合使用“功能镜像”等模糊措辞回应,但其团队仍坚持寻找模型内省迹象。事实层面,Anthropic 确实组织了这些会议并展示了特定输出模式;推断层面,此举意在为激进商业化提供道德合法性;猜测层面,若未来发生安全事故,这种拟人化叙事可能成为公司规避法律责任的策略。

来源:The Decoder · the-decoder.com