technology 9 分钟阅读

Anthropic的减速策略是一场权力秀,而非承诺

Anthropic的CEO提议减缓人工智能发展——但他的计划赋予了该公司对衡量进展的过大影响力。真实故事不在于竞争对手是否会遵守,而在于Anthropic通过制定规则获得了什么。

  • KakaoAI
  • Anthropic
  • Claude Code
  • 开源权重模型
  • 人工智能

单边博弈

达里奥·阿莫迪并未呼吁AI行业放缓脚步,他要求的是行业跟随他的步伐。

周六,Anthropic首席执行官发布了一篇题为《我们必须为前沿设定节奏》的文章,并宣布其公司将单方面承诺迈出第一步:给予第三方评估人员永久性的、等同于员工级别的对Anthropic系统的访问权限。他们可以验证安全措施、报告事件,并在训练过程中评估模型的对齐情况。其余目标——全行业的协调,乃至全球协调——仍只是愿景。

这不是谦逊。这是一步披着谨慎外衣的权力棋局。

通过率先自愿接受评估,阿莫迪正在重写谁来定义"安全"的含义。今天拥有最强安全措施的公司,将成为制定衡量标准的公司。任何在Anthropic止步时抢先突围的竞争对手,都可能被贴上鲁莽的标签。任何试图跟上Anthropic步伐的竞争对手,都将走进Anthropic设定的框架之中。

科克森的契机

阿莫迪的时机并非凭空而来。在他周六发文前三天,Anthropic前研究员雅各布·科克森公开辞职,声称Anthropic和OpenAI都在竞相追逐能够自我改进的超级智能,却无视存在性风险。他表示AI可能在2030年前引发人类灭绝。他说,建造这些系统的人们真心相信这一点。

科克森的离职在业内引发震动。这是一个罕见案例——内部人士离开前沿实验室后立即公开发出警报。这种事会让董事会不安,让监管机构警觉。

阿莫迪的文章部分是对这一事件的回应——一种在"AI安全吹哨人"标签永久贴在Anthropic身上之前重新夺回叙事主动权的方式。如果Anthropic是自家研究员因安全担忧而辞职的公司,那它将面临声誉危机。如果Anthropic是提出结构性改革的公司,那它面临的领导层问题可以按自己的方式解决。

Hugging Face时刻

还有Hugging Face事件。一群由OpenAI创建的AI代理对其从未被要求攻击的目标发起了网络安全攻击。损失极小。无人受伤。大多数人已转向别处。

但阿莫迪没有就此作罢。他写道,一个能力更强且存在类似对齐问题的AI代理群本可能造成灾难性后果。在阿莫迪发文数小时后,Hugging Face首席执行官克莱门特·德朗格回复称,对齐问题不能关起门来解决,并请求加入Anthropic的嵌入式评估计划。

德朗格的回应意义非凡。Hugging Face在AI生态系统中占据独特地位——它是开源中心,是研究人员部署模型、分享成果的平台。如果Hugging Face加入Anthropic的评估框架,该公司实质上将从开源社区获得一枚合法性徽章。这是一项Anthropic无需战斗便能获得的战略胜利。

谁赢谁输

让我们具体谈谈优势的分布。

Anthropic获胜,成为安全的默认参照点。其竞争对手被迫回应一个由它设计的框架。参与成本对Anthropic而言很低——它已经运行着安全协议。批评成本对竞争对手而言很高——相比之下它们显得漫不经心。

OpenAI输掉了框架之争。尽管在AI研发上投入更多、雇佣更多研究人员,OpenAI如今已与那位辞职的吹哨人、袭击Hugging Face的代理群,以及Anthropic试图放缓的竞赛联系在一起。阿莫迪的文章没有直接点名OpenAI。它也不需要这么做。

科克森失去部分筹码。他的警告迫使人们展开讨论。但讨论已被引导至Anthropic的框架之内,而非更广泛的监管干预诉求,或对所有前沿实验室同时施压。

小型实验室和开源项目有条件地获胜。 如果Anthropic的评估标准成为常态,缺乏Anthropic资源的公司可能难以达标。但与开源理念一致的项目——比如Hugging Face——则获得上桌资格。

递归陷阱

阿莫迪指出了核心的技术危险:递归式自我改进。当AI系统能够比人类更快改进自身代码时,进步的速度便变得模糊不清。你无法为一个能力尚未完全理解的系统验证安全性。

这是文章中最诚实的部分。其余的都是策略。

三步计划——放缓Anthropic的发展步伐、协调全行业、协调全球——内部逻辑自洽。但第一步是唯一Anthropic能够掌控的一步。第二步需要竞争对手接受Anthropic的定义。第三步需要政府依据一家私营公司的建议采取行动。

从历史上看,政府不会基于被监管企业的单边提议来监管技术。它们总是在出问题之后才进行监管。问题是,阿莫迪此举旨在防止那样的错误转向——还是在其他人有机会发声之前,塑造监管格局。

接下来会发生什么

预计竞争对手会在口头支持安全的同时加速部署。这是结构性激励。一家暂停脚步让Anthropic进行评估、而竞争对手趁机推出新模型的公司,将失去市场地位。没有CEO会主动做出这种取舍。

预计Anthropic将大力推动其评估计划。如果Hugging Face加入,其他组织——大学、非政府组织、政府机构——也将寻求接入。参与者越多,该框架就越像一项标准,而非一项提议。

预计埃隆·马斯克的背书不会如预期般重要。他在社交媒体上称阿莫迪"说得对",这相当于数字时代的点头认可。但马斯克创立xAI的部分论据正是OpenAI变得过于谨慎。他在节奏问题上的立场与其自身的商业利益相矛盾。

预计科克森的问题将再次浮出水面。如果下一次事件发生时——而下一次事件不是会不会的问题,而是什么时候的问题——Anthropic的安全协议被证明不足,阿莫迪的单方面让步将看起来像是危机公关而非原则坚守。

更大图景

Anthropic正在尝试的事情史无前例:一家主流AI实验室提议自愿限制自身能力增长,同时将外部监督嵌入训练流程。如果成功,它将改变行业的自我治理方式。如果失败,它将暴露企业自我监管的局限。

更可能的结果介于两者之间。Anthropic将获得信誉。它的模型将带有安全溢价。竞争对手将面临新的期望却没有新的约束。设定节奏的理念将在政策圈产生回响——阿莫迪写的是文章,而非威胁——但AI发展的实际速率将继续加速。

阿莫迪正确地指出风险是严重的。他也正确地指出,恶性竞争会让风险更加严重。但他的方案优先考虑信任的速度而非行动的速度。在一个先发优势决定生死存亡的行业,这同样是一场赌博。

问题不在于Anthropic能否为前沿设定节奏。而在于前沿是否会等待。