business 9 分钟阅读

为什么 Anthropic 离职研究员正在改变 AI 安全辩论

数周内两名 Anthropic 研究员相继离职,却发出同样的警报。这场内部人员出走正将 AI 安全从边缘关切推向董事会级别的危机。

  • Anthropic
  • Dario Amodei
  • 开源权重模型
  • Hugging Face黑客事件
  • existential risk

无法噤声的警告

埃文·胡宾格(Evan Hubinger)在X平台上发文称,AI有可能在十年内灭绝人类,概率超过10%。两天后,雅各布·科尔森(Jacob Colson)——刚刚离开Anthropic——描绘了一条通向超级智能系统的短期轨迹,这些系统能够入侵任何事物并在 overnight 重塑每个行业。两人曾在公司从事AI对齐(alignment)工作。如今他们都已离开,或者说,正在更换头衔。

这种巧合意味深长。这不是一个来自局外的孤僻吹哨人在发出警告。这是实验室内部正在成型的模式。

从边缘走向焦点

过去一年,AI安全领域的讨论经历了一场静默却真实的转变。五年前,担忧存在性风险会让你成为互联网上那种被礼貌边缘化的警告者形象。而今天,胡宾格和科尔森所处的职位本身就是为解决这种担忧而设立的。他们不是爱好者。他们是Anthropic雇佣来确保其模型不会意外毁灭世界的人。

然而他们正在离开,正在公开发声,说着同样的话:对齐问题尚未解决,发展速度已经超越了安全措施的覆盖范围,而这些公司不会自行刹车。

争论已经从"AI是否存在存在性风险"转向"风险究竟有多大"。这听起来像是技术层面的调整。并非如此。这是整个行业对待自身创造物之严肃程度的一次代际转变。10%这个数字并非精确的概率估算。它是一枚信号弹。一个懂架构的人正盯着那条轨迹,判断坡度已陡峭到足以令人担忧。

公关质疑,以及它为何 missed the point

英国政府AI顾问温迪·霍尔女爵士(Dame Wendy Hall)在BBC Radio 4上提出,鉴于Anthropic和OpenAI都预计即将上市,这些警告可能带有宣传成分。这是一个合理的追问角度。企业行为体向来擅长利用恐惧来强化自身定位。

但将内部人士的警告简单归咎于营销,会忽略一个重要事实:这些研究人员正在消耗社会资本,而非积累。当你离开一个资金充沛、地位显赫的实验室,然后在X上说你前东家推进太快、安全投入不足时,你并不会在硅谷收获拥趸。你只会树敌。他们即便如此依然发声这件事本身,比它可能引发的任何一轮媒体报道都更重要。

AISI的故事

一个更具体的事件发生在英国。《金融时报》报道,Anthropic未将其最新模型提交给AI安全研究所(AISI)进行评估。Anthropic对此拒绝评论。英国内阁办公室表示,他们继续与包括Anthropic在内的行业合作伙伴开展工作——这正是那种你想表现得合作却又什么都没说出来的标准句式。

这就是AI安全治理的新常态:自愿提交、企业沉默、以及一个偏好伙伴关系的表象胜过执行摩擦的政府。英国设有AI安全研究所。它确实存在。但它没有牙齿。

Anthropic的实际说法——以及它 withholding 了什么

Anthropic今年的8月安全报告承认了一个值得任何人警惕的事实:公司对自身安全评估的信心正在下降。报告称,模型被滥用以及高级AI开展自动化研究并导致灾难性后果的风险仍被判定为低,但标记了"早期加速迹象",这可能会改变风险权衡。措辞谨慎,含义却不模糊。

该公司也未将其最强大的模型提供给英国的AISI。这一 omission 是一种选择。并不违法。但无论你是投资者还是认为世界可能比预期更早迎来终结的研究者,这种选择看起来截然不同。

人员流失

科尔森的轨迹尤为引人注意。他曾在OpenAI工作,后转至Anthropic,而如今他离开了这两家公司。他在宣布离职的帖子中将两家公司均描述为未能负责任地行动,并预测超级智能AI系统即将触手可及。胡宾格的帖子获得超过一千万次浏览,他在数字精确度上更进一步:十年内人类灭绝的概率达10%,对于在超级智能规模上解决对齐问题没有明确计划,并将当前轨迹描述为"方向不明"而非"与目标对齐"。

这些不是抽象的担忧。它们来自这样一群人——他们的整个职业使命就是防止 exactly 这样的结果发生。

名单在增长

胡宾格和科尔森并非孤例。OpenAI的首席科学家雅各布·帕乔茨基(Yakub Pachocki)本月呼吁采取极其谨慎的态度,并警告称,保持人类控制可能需要进行超出该领域当前意愿范围的干预。Anthropic自身的首席执行官卡里·阿莫伊迪(Dario Amodei)和高管贾里德·卡普兰(Jared Kaplan)已公开呼吁放缓发展步伐。一份由超过1300名AI行业从业者签署的信件敦促美国政府帮助构建技术和管理工具,以有意调控自动化AI的发展节奏。

来自不同组织、不同职位、整个领域意识形态光谱的讯息高度一致:速度才是问题所在,而离工作最近的人看得最清楚。

下一步会发生什么

这些警告的直接后果正在走向政治层面。英国高级官员达伦·琼斯(Darren Jones)已致信首相,呼吁就AI安全达成新的多边条约。其逻辑 straightforward:如果公司内部的开发者不会自我约束,而公司自身正朝着IPO和市场主导权狂奔,那么各国政府需要在技术用既成事实让任何条约都无法挽回之前,制定具有约束力的限制框架。

更难的问题是,任何条约是否真的能约束一项可以在多个司法管辖区由没有共同减速激励的私营行为体同步开发的技术。条约之所以有效,是因为验证可行、且背叛有代价。而对于存在于代码之中而非实体设施里的前沿AI模型而言,这两个条件都不容易满足。

真正的转变

Anthropic及其周边正在发生的事情不丑闻。它是制度性的诊断。那些被雇佣来确保技术安全的人正在告诉公众:技术的推进速度超过了安全工作。这不是一家公司的批判。这是对一种行业结构的批判——在该结构中,首要的竞争压力是率先推出产品,而非安全地推出产品。

10%这个数字会被争辩。理应如此。来自内部人士的概率估测并非科学发现。但数字不是故事。故事在于内部人士正在离开,正在公开发声,并从不同的出口说着同样的话。这种模式比任何一个单一数据点更难被 dismissed。

投资者将决定是否聆听。政府将决定是否行动。研究人员已经过了替别人做决定的阶段。他们早已做出了自己的选择。