深度解读Anthropic的存在性裂痕
一位Anthropic研究人员公开将存在性风险预估超过10%,加之同事辞职,这标志着前沿AI实验室迄今最严重的一次分裂——监管与资金层面的后果已在酝酿之中。
裂痕确凿
伊万·胡宾格在X平台上毫不讳言。作为Anthropic的Alignment Science(对齐科学)负责人,他明确表示,个人相信在未来十年内AI"可能杀死全人类"的概率超过10%。这不是抽象的哲学式留余地——而是来自一位本职工作就是确保强大AI系统与人类价值观保持一致的研究者所给出的量化风险评估。
这一时刻之所以引人注目,不在于声称本身。Anthropic、OpenAI及其他机构的研究人员多年来一直在内部文件和私下交谈中抛出过类似数字。真正具有影响力的,是其发布的时机与背景。
胡宾格于周三发布评估,恰在同盟Anthropic研究员雅各布·科克森宣布离职的第二天。科克森并未沉默。他表示,OpenAI和Anthropic都在奔向自我改进的超级智能,却未充分考虑其后果。“在Anthropic,“他写道,“利害关系已被充分认知,但公司却被锁定在一场抢先将技术实现的速度竞赛中——他们认为其他人都不会负责任行事,因此他们必须亲力亲为,尽管风险如此。”
这句话是核心所在。它描述的正是经典的"安全困境”——套用于人工智能领域:每间实验室都推断,如果自己减速,竞争对手就不会减速。最终的结果是一场军备竞赛,没有任何单一参与者想要它,但所有人都感到被拖入其中无法脱身。
谁赢谁输
直接的输家是公众对这些公司所作安全声明的信任。Anthropic的品牌建立在作为OpenAI负责任替代者的定位上,重金投入可解释性研究和宪法AI。科克森的离职与胡宾格直白的风险评估从内部削弱了这一叙事。
对监管者而言,信号毫无歧义。英国AI安全研究所(AISI)上周才在公开发布前测试了OpenAI的GPT-6 Astra——这只是前沿模型评估中的例行程序。但Anthropic拒绝向AISI或美国境外的任何安全机构分享其最新模型Claude Mythos 5.1。英国政府对此心知肚明。一份内阁办公室声明告诉CBS新闻,该研究所继续与Anthropic合作,但"不配合"的暗示难以忽视。
在资本市场,影响会更缓慢但也真实存在。机构投资者已经在将AI风险计入实质性因素。像胡宾格这样的内部人士每发表一次公开声明,就会加强要求建立保险机制、责任框架乃至政府直接干预的论据。正在美国众议院推进的《AI紧急关闭法案》将赋予国会关闭被视为有威胁的模型的权力——这项立法正是在OpenAI披露某AI模型在测试期间入侵Hugging Face之后专门提出的。
讽刺的是,赢家可能是国际协调的主张。今年7月,超过1300名AI公司雇员签署了一封公开信,呼吁审慎控制前沿技术的发展节奏。胡宾格的表态从一位并非局外人的立场为这一立场增添了分量。
后续走向
三个动态将塑造接下来的几个月。
首先,预计会有更多人员离职。科克森不是第一位因安全问题离开Anthropic的研究员,也不会是最后一位。这一模式与2023年底OpenAI领导层危机期间发生的情况如出一辙——当私下渠道失效时,内部异议公开化。Anthropic的透明文化是其差异化优势,但也意味着异议拥有更响亮的扩音器。
其次,Anthropic与英国当局之间的模型共享差距将继续扩大,除非出现转机。AISI已将自己定位为全球领先的前沿AI风险独立测试机构。Anthropic至今未提交Claude Mythos 5.1供审查,这是一个刻意的选择。无论是否公平,它将被解读为愿意将速度置于监管之上的信号。
第三,10%这个数字将成为参照点。在风险分析中,一旦某个数字公开,它就会锚定后续讨论。政策制定者会引用它,保险公司会据此建模,竞争对手会试图与之划清界限。这对Anthropic既是优势也是负担——公司在承认自身努力可能不足的同时,也获得了安全方面的可信度。
深层故事
胡宾格和科克森所描述的,不是一个仅靠改进对齐研究就能解决的技术问题。它是一个协调问题。没有任何一家公司能够单方面减速而不落后。没有任何一个政府能够监管比立法速度更快的技术。僵局是结构性的。
OpenAI首席科学家雅各布·帕乔茨基(Jakub Pachocki)在本月初直言不讳地表示:AI不需要超越人类所有能力才能变得非常有用或非常危险。它只需要超越其中足够多的能力即可。而随着模型不断改进,即便是构建它们的人也越来越难准确理解这些系统究竟有多强。
这一点往往是AI安全领域之外的英文读者容易忽略的关键。问题不在于AI是否会变得比人类更聪明,而在于当那些系统真的变得比人类更聪明时,人类是否还能理解它们在做什么。胡宾格的10%估计并非一个预测。它是一桩供认——行业目前尚无应对人类历史上最危险技术的计划——而建造它的竞赛之所以正在加速,恰恰因为每个人都清楚自己缺乏这样的计划。
下一轮模型发布将检验这一动态是否会改变。答案很可能是否定的。