business 12 分钟阅读

Anthropic研究员因AI存在性风险担忧辞职

一名27岁的Anthropic预训练研究员已辞职,警告失控的AI系统可能在明年年底之前脱离人类控制。此次离职正值Anthropic推进2万亿美元IPO之际,为硅谷的安全恐慌增添了一抹韩国媒体视角。

  • Anthropic
  • 韩国
  • AI市场
  • 开源权重模型
  • 人工智能
  • existential risk
  • 递归自我改进

无人预料到的叛离

雅各布·科克森(Jacob Coxon)今年27岁。他曾在OpenAI工作,后转入Anthropic,被这家公司对AI安全明确承诺所吸引——这一 niche 价值主张逐渐演变为Anthropic的品牌标签。然而就在9号,他离开了。

他的理由直言不讳:他不认为任何一家公司能在没有政府强制规定或全行业限速的情况下负责任地开发通用人工智能(AGI)。他警告称,若缺乏这类护栏,递归自我改进系统——能够重写并升级自身代码的模型——可能在明年年底前达到人类无法控制的临界点。

这一预测极具攻击性。时机对Anthropic而言也颇为尴尬。该公司目前正推进首次公开募股(IPO),目标估值高达2万亿美元。一位离职研究人员在宣传之旅上直言其同事所做的工作可能终结人类,这并不是你希望出现的舆论叙事。此外,科克森的离开正值Anthropic暗中扩大研究产出的同时,却在公开场合鼓吹谨慎——这一矛盾让投资者和监管机构都难以忽视。

科克森并未泄露文件,也没有指控Anthropic失职。他只是陈述了自己对这项他参与构建的技术发展轨迹的看法。正是这种克制,使他的警告更加令人不安,而非减轻。这表明有人身处实验室内部,亲眼目睹能力曲线加速攀升,并最终认定机构激励与风险状况已然错位。

这不仅仅又一位安全吹哨人

科克森并非首位表达生存风险焦虑的研究人员。OpenAI自身的安全领导层今年也有离职人员。科克森案例值得关注的原因在于,他给出了具体的时间表,并且站在机构视角发声。

他从事的是预训练工作——这是发生最大能力跃升的基础层。这不是一个边缘角色。正是在这里,最强能力的模型被构建出来,之后才会进入对齐(alignment)环节。他对递归自我改进的担忧也与常见的“AI会失控”论调不同。他不是在警告恶意,而是在警告能力超出控制。

他所描述的逻辑链条很直接:一个能够自我改进的模型,结合获取自身资源和绕过安全限制的能力,会形成反馈循环。人类操作员无法重新指令一个比自己反应更快的系统重写自身目标。这不是科幻。这是当前自动推理、软件工程代理以及大型语言模型在生产环境中获得日益增长自主权等趋势的逻辑终点。

科克森具体岗位带来的次生影响也值得注意。预训练研究人员处于能力与安全的交汇点。他们在对齐工作开始前就清楚模型的能力边界。他们直接面对那些毫无预警出现的涌现行为。从这个岗位离开比从产品或运营团队离开分量更重,正是因为预训练流水线是失控变量集中的地方。

韩国视角

这个故事通过韩国领先的科技媒体《AI Times》率先报道,该媒体通常以地区影响为着眼点报道国内产业。一家韩国媒体发布此分析——并将科克森的离职与Anthropic的IPO策略联系起来——这表明东亚科技圈如何解读硅谷内部的安全争论,其中传递了重要信号。

韩国AI实验室并非旁观者。它们正处于同一场竞赛之中。与英语新闻编辑室往往将生存风险警告框架化为抽象哲学不同,韩国科技记者将其视为竞争情报。报道中隐含的问题不是AI安全是否重要,而是当竞赛结束时谁才是最安全的。

这种重构很重要。在首尔和东京,科克森的离职很可能被同时读解为警告和竞争信号:如果美国最顶尖的安全研究人员纷纷离开自己的公司,那么坚持治理框架的公司可能在监管严格的市场上占据优势。三星电子(Samsung Electronics)和SK海力士(SK Hynix)等韩国财阀已在AI基础设施上大量投资。它们也是首批面临严格国内AI监管的企业。讽刺的是,科克森提出的安全关切最终可能反而强化那些率先推动治理的管辖区中公司的监管话语权。

次生效应:实验室之外的涟漪

科克森的离职不太可能改变Anthropic的技术轨迹,但可能改变其IPO的评估逻辑。机构投资者越来越关注AI风险敞口——不仅针对投资组合公司,也针对整个更广泛的行业。一场宣传之旅中途高调的安全离职,在风险评估中引入了新的一项:其他研究人员可能在内部持有科克森的担忧,只是尚未找到开口的勇气。

此外还有声誉外溢效应。Anthropic的品牌建立在负责任开发之上。科克森事件迫使公司在本应展现信心的时刻转入防御姿态。每一次有关此次离职的媒体询问都会引发与其实际安全记录的比较。公司将需要回答:是否认真对待科克森的警告,还是置若罔闻——无论哪种回答都有代价。

政策层面,科克森的名字可能已在华盛顿、布鲁塞尔和首尔的立法人员团队中流传。寻找证据证明自我监管不足的政策制定者,将在一位实际从事他如今警告工作的研究人员身上找到佐证。一位离职工程师的个人证词比任何关于AI风险的学术论文都更有说服力,而科克森正属于这一类别。

谁赢谁输

Anthropic在其核心品牌 premise 上损失了公信力。该公司将自己定位为OpenAI“快速行动”路线的负责任替代方案。一位预训练研究员在IPO周期中途因完全相关的担忧辞职,无论底层恐惧是否得到验证,都是声誉打击。这不只是公关损失——而是最初支撑溢价估值的差异化优势的侵蚀。

科克森一无所获。他公开宣称,构建这项技术的人相信它可能在十年内杀死所有人。这是一句无论对谁来说都不会加分的职业宣言。做出类似声明的研究人员往往在未来雇主那里被边缘化,或被招入倡导组织而非产品团队。行业对预言家的容忍度有限,即使预言最终被证实正确。

整个行业失去了一位有意义的监管候选人。离开的人不会成为监管者。他们成为警示案例——或者加入倡导团体。这两条路径都无法放慢Google DeepMind、OpenAI或中国及欧洲数十家资金充裕实验室的实际开发进度。

政府获得了更有力的例证,说明为何自我监管未能奏效。科克森的离职为AI监管的政治倡导者提供了一个具体的人性故事,而非理论推演。

接下来会发生什么

关注三件事。

第一,在IPO定价前是否有其他Anthropic研究人员追随科克森的脚步。一系列离职会向投资者发出内部裂痕的信号,不容忽视。即使仅多一人辞职,叙事也会从异常转为趋势。

第二,2万亿美元的估值目标能否维持。市场为风险定价,生存风险的负面冲击仍是风险因素,哪怕它看似抽象。如果科克森的担忧在金融媒体中获得共鸣,将直接反映在对Anthropic未来现金流的折现率上。

第三,韩国和欧洲监管机构是否会在即将到来的政策辩论中引用此次离职。科克森的名字不会出现在立法文本中,但从安全导向实验室离职的模式已为“自愿承诺不足”的论点提供支撑。

更清晰的收束

科克森的故事不只是关于一名研究人员离开一家公司。它是关于一条多年来形成的断层线终于在公众视野中裂开。AI安全社区长期以来 operating on a spectrum:一些研究人员大声警告,另一些人幕后 quietly 工作,许多人选择沉默,希望从内部影响结果。科克森的辞职代表了第三种策略的失败。他留下过。他试图在体制内工作。最终他认定体制的推进速度已超过任何内部倡导所能约束的范围。

使他的案例具有历史意义的,并非警告的极端性——生存风险的说法早已出现——而是他的机构地位、时间线的具体性,以及发表时机的组合。一场IPO宣传之旅旨在传递确定性。科克森的辞职在出售股票的人最需要确定性的时刻注入了不确定性。

更深层的故事并非一名研究人员辞职。而是 across AI labs——包括东亚在内——正在蔓延的认知:安全团队注定败给算力团队。科克森早已明白这一点。他只是最新一个大声说出来的人。那些听进去的人是否会改变方向,仍是定义这一刻的问题。