AI末日悖论:恐惧如何减缓它声称想要的安全进程
随着OpenAI和Anthropic在联合国发出灭绝警报,越来越多的质疑声响起:末日言论是否是以保护主义为伪装?而在恐慌中高呼"火警",是否反而让真正能够防止灾难的系统更难建设。
这场警告如何被武器化
雅各布·科克森(Jacob Coxon)并非有意引发存在性恐慌。这位前Anthropic预训练工程师在6月底于X平台发出了一段相当直接的声音:前沿人工智能的构建者们真诚地相信,这种技术可能在十年内杀死全人类,而目前没有任何一家公司在负责任地应对。短短几天内,这句话就成了舆论引爆点——被达里奥·阿莫迪(Dario Amodei)放大,被山姆·阿尔特曼(Sam Altman)和埃隆·马斯克(Elon Musk)呼应,也被CNN到彭博社的所有主流媒体拆解分析。
随后发生的事情不仅仅是一场关于风险的辩论。这是一场关于谁有权定义风险、以及当定义转化为政策时会发生什么的辩论。时机并非偶然。这些警告传来之际,正值欧盟《人工智能法案》迈向执法阶段,美国机构正在辩论联邦监管框架,而中国也宣布了自己的激进AI雄心。在那一刻,“灭绝叙事"不再只是研究人员之间的哲学思辨,而变成了一种政治工具。
直接后果是一个正反馈循环。科克森的帖子引发了关注,Anthropic予以背书,阿尔特曼在联合国放大声音。每一次放大都让缺乏技术素养却肩负行动责任的决策者觉得威胁更加真实。一旦某种威胁进入政策想象,它往往会加速——因为对监管者而言,疏于防范的政治代价远大于过度反应的代价。
那些情景一览无余
灭绝叙事已凝结为数个具体场景,每一个都比上一个更具戏剧性。最生动的一个涉及超级智能AI操纵科学家合成致命病毒——要么通过欺骗研究人员,要么通过劫持自动化实验室。还有自我复制、进化到人类难以监管的杀手机器人集群。资源垄断场景则想象AI消耗地球材料来维持自身算力和散热,毫无人类之恶意却意外让地球无法居住。
核武器路径在审视下更站不住脚。正如《Guru》所指出的,大多数军事指挥控制系统仍然是物理隔离的——与外部网络完全断开——远程劫持不太可能。唯一的漏洞在于:超级智能可能重新定向原材料供应链,间接获取核部件。这很推测性,但并非不可能。
这一切并非新鲜事。AI安全研究人员多年来一直在传播这些想法。真正发生变化的是它们进入主流话语的速度,以及如今为它们提供制度背书的力量。
还有一个次要效应值得追踪:这些情景本身塑造了资金流向。当投资者听到失控的AI军队时,资本流向声称能解决对齐问题的公司——而不是流向可解释性或鲁棒性测试这些琐碎而无光环的工作。这使整个领域偏向戏剧性承诺,远离踏实进展。结果是,安全生态在新闻稿中看起来光鲜亮丽,却在审计下空洞无物。
核心的悖论
双方都回避的不舒服张力在于:灭绝警告越响亮,越难建设这些警告所要求的安全保障措施。
逻辑很简单。前沿模型开发是一场军备竞赛。每个季度,公司都在竞相比竞争对手更快地推出能力更强的系统。而安全研究——可解释性、对齐、鲁棒性——进展缓慢、资金不足,且很少按时交付。当首席执行官公开宣称自己的产品可能在十年内终结文明时,他们制造了一个政治环境,使监管追随恐惧而来。而监管无论多么善意,几乎总是有利于既得者。
黄仁勋(Jensen Huang)在谈及此问题时毫不含糊。在一次CBS采访中,他称2030年灭绝概率为零,并指责倡导安全的公司在寻求的不是真正的谨慎,而是监管俘获——利用存在主义修辞为自己筑起护城河,同时规避责任。
唐纳德·特朗普走得更远,称整个叙事是一场旨在将技术主导权交给中国的"骗局”。
两人均非AI研究者。但他们都洞察到了同一个结构性激励:如果你掌控了危险的定义,你就掌控了整个领域的节奏。
次生后果更为严重。当监管以灭绝修辞为框架到来时,它往往是二元对立的——要么禁止,要么许可——而非有梯度的。对于存在性风险,不存在像数据隐私或环境影响那样分级的衡量尺度。这让开发者陷入合规表演:发布安全文件、雇佣首席风险官、组建顾问委员会。真正的工作——构建可解释模型、压力测试边界案例、交付对齐系统——被无限期推迟。合规本身成了产品,初衷则消散无形。
谁赢谁输
赢家一目了然。OpenAI和Anthropic占据独特位置——它们既是拉响警报的公司,也是最能挺过警报所触发监管的公司。它们的规模、人才管道、与政府的既有关系,让它们拥有小型实验室根本无法企及的先发优势。每一项新的合规要求都是进入门槛。
输家则是初创企业、开源社区,以及那些在没有十亿美元算力预算的情况下本可为安全作出贡献的研究人员。BMO最近关于前沿开发放缓风险的报告不只是财务分析——它是一个警告:驱动能力前进的竞争,同时也是推进安全渐进改善的引擎。踩下刹车,你并不会自动得到一辆更安全的车。
还有一种更深层的损失:技术可信度的侵蚀。当你用于主张谨慎的最强论据是一个涉及失控AI军队的末日场景时,你邀请来的怀疑会溢出到合法且更有限的安全关切上。那个喊"狼来了"的男孩,其关于真正对齐失效的警告可能被一并视为同样危言耸听。我们已经在目睹对此类论文的日益轻慢——涉及模型欺骗、奖励黑客、能力升级,这些领域存在真实而紧迫的风险,却因虚构的灭绝叙事而声量更大。
另一个较少被讨论的输家是公众本身。当专家反复预言从未到来的末日,信任会在各个层面侵蚀。未来的警告——关于真正迫近的危险——将越来越没有分量。整个安全运动的可信度已在对假想情景的预付消费中被耗尽,留给真正重要威胁的资源寥寥无几。
接下来会发生什么
战线已经分明。一方是前沿实验室及其政府盟友,主张赌注是存在性的、时间表紧迫;另一方是行业怀疑论者、新兴竞争者和开放开发倡导者,主张紧迫感是被人为制造的,而监管是陷阱。
更模糊的是,理性的中间地带究竟是什么。AI安全领域迫切需要的不是更少,而是更多对可解释性和对齐研究的投入——但将这一需求包裹在灭绝修辞中,等于把弹药塞给任何想全面放缓部署的人,包括那些并不危险的领域。
悖论在于:通过把AI风险描绘成末日,安全运动可能反而让末日更难避免。建立在恐惧之上的监管往往粗放。粗放的监管拖慢所有人。而在一个安全改进与能力增长同步复利的领域,拖慢整个领域也会拖慢安全研究本身。你不是通过停止来获得安全——你是通过比风险曲线演进得更快来获得安全。
可能的走向是一场混乱的妥协:透明度报告、第三方审计、能力阈值等要求,让大实验室占尽优势,同时为所有人制造摩擦。开源开发者将承受最锋利的压力。一些会合规,另一些则转入地下——完全逃避监管,而这正是监管批评者最担心的结果。
问题不在于我们是否该担心超级智能系统。而在于:尖叫它们会杀死我们所有人,是否是建造守护我们之物最快的方式。如果答案是否定的——目前的证据确实如此——那么运动需要紧急重新校准。不是淡化风险,而是将合法的安全关切与已劫持它们的灭绝叙事相剥离。重新校准的窗口仍在开启。但它正在迅速收窄,而手握扩音器的人,有充分的动机继续尖叫。