business 11 分钟阅读

Anthropic 研究员因 AI 风险离职,此次离开意味着什么

Anthropic 一名 27 岁的研究员辞职,警告超级智能 AI 可能在十年内引发人类灭绝。故事看似不大——一个人离开——但 Anthropic 自身对齐研究主管的内部背书,让它变得难以忽视。

  • Anthropic
  • Dario Amodei
  • 开源权重模型
  • Motif
  • existential risk

不只是一次离职

雅各布·科克森(Jacob Coxson)今年27岁,英国人。他在今年年初曾在OpenAI工作,随后转投Anthropic——并非因为理想破灭,而是因为他认为Anthropic的安全文化更能让负责任的AI愿景成真。但到了九月,他又离开了,原因截然不同。

科克森在X平台发文警告称,追逐构建自我改进型AI系统的竞赛正在把安全议题推向边缘。他告诉《华尔街日报》,业内大多数开发者真心相信,这项技术可能在一代人的时间之内夺去全人类的生命,而明年或许就已经太晚、无法夺回控制权。

仅此一端已足以引爆头条。但这个故事的独特之处,在于后续发生的事情。

内部的证实

伊万·休宾格(Evan Hubinger),Anthropic对齐科学负责人,没有与之撇清关系。他表示科克森是对的,并给出了自己的概率判断:未来十年内,AI导致人类灭绝的概率超过10%。

领导Anthropic可扩展监管(Scalable Oversight)团队的塞缪尔·马克斯(Samuel Marks)给出了几乎相同的评估——同样以个人观点表述,而在这个语境下,这已是该公司最接近机构层面承认的表态。马克斯更进一步,指出一个令他震惊的模式:AI开发者的职级越高,越倾向于表达对存在性风险的严重担忧。

然而研发仍在继续。

马克斯将这一矛盾归因于两种力量。其一是商业激励——减速的公司恐将被甩在后面。其二是更为务实的恐惧:如果负责任的参与者选择退让,不法之徒便会加速推进,最终结果只会更糟。

这正是当下绝大多数AI安全辩论所围绕的框架。同样也是将普通人几乎完全排除在外的框架。

为何一次离职的重量非同小可

科克森的离职并非Anthropic大规模人流失的开始。但其重要性恰恰源于他是谁、来自何处。他不是以批评者的姿态投奔Anthropic的。他于一月加入,是被公司公开承诺的对齐研究所吸引。因此他的离去,不是局外人在场边抗议的故事——而是一个深入内部之后,认定结构本身即为问题的人的故事。

他对OpenAI和Anthropic的批评毫不客气。他告诉记者,两家公司都没有负责任地行事,将业界疯狂追逐超智能的进程形容为一场拿人类生命当赌注的豪赌。他认为,一个由少数工程师群体决定能够重塑文明的技术走向,这本身就是一种疯狂。

这一区分很关键。当行业外部的批评者发出这些预警时,很容易被当作卢德分子或博眼球的哗众取宠者轻松打发掉。但当一位27岁的研究者——专门出于安全导向而选择加入Anthropic——得出了同样的结论,叙事便发生了偏移。

留下的人们与签署者

科克森并非孤身一人。今年早些时候,他签署了一份呼吁各国政府建立国际框架以减缓AI发展速度的声明。签署者包括一千多名研究者,其中就有Anthropic首席执行官达里奥·阿莫迪(Dario Amodei)和OpenAI首席科学家雅各布·帕乔茨基(Jakub Pachocki)。

这份名单的价值不仅在于它包含什么,也在于它遮蔽了什么。阿莫迪和帕乔茨基正是领导着科克森如今指责正以人类未来为赌注的那两家公司的核心人物。他们在一份警示性声明上签字,并不必然意味着他们会减速。这只意味着审慎的话语已经嵌入了行业的DNA——尽管引擎仍在全速运转。

这份签署者名单所记录的,与其说是一场协调一致的克制呼吁,不如说是一种共享的警报词汇。同一批签署声明的领袖,同时也在主导公司历史上迭代最快的研发节奏。公共表态与运营节奏之间的鸿沟,才是这个故事真正存在的地方。

没有人谈论的次生效应

科克森离职最具决定性的影响,可能并不会立刻显现。它更为微妙,将在未来数年中逐步展开。

首先是招聘信号。Anthropic多年来一直在塑造一种声誉:这是一家安全研究员可以在不被催促加速推出的压力之下做最好工作的公司。如果初级研究员开始意识到,即便看似最安全的环境也无法容纳关于存在性风险的诚实警告,这种叙事就会失去说服力。这家以信任立牌的公司,现在被要求解释:为何它的信任未能留住一位因它而离去的研究员。

其次是媒体反馈循环。科克森的故事不会是最后一个。每一家顶级安全实验室有人因存在性风险而离职,都会为下一位离职者增添一层可信度。当发出警告的人正是那些主动选择了以安全为先的实验室、而非选择速度更快的竞争对手的人时,“这些警告只是边缘或夸大其词"的说法便越来越难以维系。这种怀疑态度的侵蚀,是任何公司都难以轻易控制的。

第三,也是最悄无声息的一点,在于投资者关系。2024年,Anthropic从亚马逊和软银那里筹集了64亿美元,理由是将在安全AI领域领跑。如果市场开始将存在性风险视为影响估值的实质性因素——而非仅仅是公关话术——围绕这些公司的金融架构就开始发生位移。资本配置者尚未对此定价,但框架已经存在。唯一的问题只是时机。

地缘政治层面

科克森发出警告的时机,恰逢一个格外动荡的时刻。中国带着强有力的国家支持进入了AI研发竞赛,这让任何考虑减速的公司或国家都面临着更高的博弈筹码。特朗普政府已释放出偏好最小监管的信号,从而移除了制约研发速度的主要外部力量。

对于美国以外的读者来说,这有着直接的后果。华盛顿的政策环境塑造着全球竞争格局。如果美国选择放松管制而其他国家施加约束,激励机制就会明显向速度倾斜而非谨慎——正是科克森所描述的那种动态。

但地缘政治的维度是双向的。美国撤出AI监管,并不意味着全世界都会随之跟进。欧盟已通过《人工智能法案》向具有约束力的规则方向迈进。中国由国家主导的模式则产生了自身的加速压力。结果是碎片化的监管格局,这让协调——正是科克森和签署者们所呼吁的——变得指数级困难。

下一步会发生什么

这次离职提出的实际问题,不在于Anthropic是否会失去更多研究员。而在于公司管理层是否会让内部异议转化为与休宾格和马克斯私下对话相匹配的公开立场声明。

Anthropic始终将自己定位为OpenAI之外的负责任之选。这种定位具有商业价值。但它同样脆弱。每一位 echo 科克森评估的高管——目前已有两位——都让公司在不承认言论与行动之间差距的情况下维持当前轨迹变得更加困难。

科克森呼吁政府干预和行业范围协调,这并不是新主张。新的是,一位内部人士如此清晰地说明了这些机制为何迄今为止失败。问题不在于缺少警告。而在于无论警告多么可信,若无政治压力推动,就无法撬动市场或监管。

接下来的几个月将告诉我们,科克森的离职是否会引发超越一轮采访周期的实质性变化——还是仅仅成为这个早已充斥着同类信号的行业中的又一个数据点。但更深层的检验将在稍后到来:它将体现在留在Anthropic的研究者是否仍相信自己有途径影响公司方向,还是也开始像科克森一样计算沉默的代价。这才是这个故事真正要回答的问题。不是一次离职,而是当最有能力预防灾难的人得出结论——他们身处的结构使得预防已不可能——随之发生的一切。