AI安全吹哨人的时刻终于到来
Anthropic的两名研究人员公开宣布人工智能存在生存性风险,将相关辩论从实验室走廊推向了议会和条约谈判桌。这一时机意味深长。
Anthropic 泄露事件不只是新闻——它是某种信号
埃文·胡宾格没有发表同行评审论文,他在 X 上发了一条帖子。不到一分钟,这条信息便触达了超过一千万人:Anthropic 的一名高级研究员认为,人工智能在未来十年内灭绝全人类的可能性超过百分之十。
百分之十。这听起来可能很抽象——一个你可以耸耸肩、塞进风险矩阵的数字——但它意在让人感受到具体而切实的威胁。这是医生绝不会让患者走出诊室的概率级别。而胡宾格专攻 AI 对齐(alignment),他表示,当前已存在的模型所带来的风险尚低;真正令他担忧的是自我改进:AI 系统快速重写自身代码,足以超越当初创造它们的人类。
这条帖子发布的同一周,雅各布·克森——一位同样刚刚离开 Anthropic 的前 OpenAI 研究员——宣布这两家公司都未曾负责任地行动。这种呼应呈现出一种形状,看起来更像行业内部的协调信号,而非巧合。
两人均未明确说明人类灭绝的具体机制。这一省略很重要。多年来,关于 AI 风险的公共讨论一直局限于哲学系和推测性论文竞赛之中;而如今,它正由那些靠他们所警告的公司领薪水的业内人士,用直白的语言说出来。
谁受益,谁受损
直接的受益者是那些花了数年向漠然受众宣讲同一套警示的研究人员。胡宾格和克森现在拥有的平台,是任何学术期刊都无法比拟的。他们的言论将被引用于议会、国会听证会、社论和policy草案中。
受损方更难命名,因为损害尚未被衡量,但方向已清晰可见。任何一家曾试图将自己定位为仅仅构建有用聊天机器人和编程助手的公司,现在都必须回答一个上月无需回答的问题:既然你们自己的研究员都承认无法确保超级人类系统对齐人类价值观,我们凭什么把基础设施托付给你?
Anthropic 的公开姿态一向以谨慎为标志。公司的创始叙事、其对"宪法 AI"的强调、分阶段而非一次性发布 Claude 的决策——这些都被包装为负责任的证据。而两位研究员的发帖暗示,营销可能已经跑在了工程之上。
担任联合国 AI 顾问的温迪·霍尔女爵士直言不讳。她告诉 BBC 自己感到震惊,同时提出了一个令所有涉事方都不舒服的可能性:其中一部分可能是表演。Anthropic 和 OpenAI 都在为预期的上市做准备。一名研究员在公司准备上市之际公开警告存在生存风险,在一些观察者看来,这是一步精算过的棋。无论是否如此,这种暗示本身便损害了警告的可信度——而这正是霍尔这番话所带来的次生伤害。
政策之门正在打开
这一事件中最重要的发展并不在 X 上。它是一封由前财政大臣秘书达伦·琼斯致首相安迪·伯纳姆的信函——琼斯坦普尔政府时期担任此职。琼斯呼吁制定一项管控 AI 安全发展的新型多边条约。他的论点简洁而令人警醒:如果政府现在不介入,发展速度将超过治理速度,问题会在任何人开始研究它们之前就降临。
琼斯并非边缘声音。他身居英国经济政策的核心。他的介入是一座连接实验室与立法机构的桥梁,而这正是 AI 安全运动多年来一直在努力搭建的桥梁。
情况进一步复杂化的是,《金融时报》报道 Anthropic 将其最新模型 withheld 于英国 AI 安全研究所之外——这是全球最知名的 AI 风险评估机构之一。Anthropic 拒绝评论。内阁办公室既不确认也不否认,仅表示"继续与合作伙伴共同推进模型更安全"。这种不置可否本身即是一个数据点:它表明要么扣留属实且存在争议,要么政府不希望将争端公开升级。无论如何,一家以安全为品牌核心的公司正被要求解释:为何它不愿将产品提交给旨在评估其安全宣称的机构。
对齐问题仍未解决
胡宾格在谈及"对齐"——即将人类伦理原则编码进 AI 系统、防止其漂移到人类不愿追求的目标——时毫不隐晦。他表示,Anthropic 目前尚无解决超级智能对齐问题的计划,也未明确走在制定该计划的轨道上。来自公司内部的这番坦白,比任何外部批评都更有分量。
与此同时,Anthropic 去年八月的安全报告承认了信心程度的转变。该公司此前曾评估其模型与强大组织意志发生偏离并被利用或篡改的风险为低,也将高度能力化的 AI 执行可能导致灾难性后果的自动化研究的评为低风险。但报告加上了一个限定语:与之前相比,眼下对此评估的把握较小。
这是一种目睹新数据后心生不安的组织才会使用的措辞。报告还提到了加速迹象的早期信号。“加速"在 AI 安全文献中并非隐喻——它指的是一种可能:某项能力的提升反哺另一项能力,形成超越人类监督的反馈循环。
今年早些时候,OpenAI 也面临过类似的清算时刻,其首席科学家雅库布·帕乔茨基呼吁极度谨慎,并警告可能需要更多干预以确保人类掌控未来。整个行业中,包括 Anthropic 的达里奥·阿莫代伊和贾里德·卡普兰在内的关键人物近期都在敦促放慢前沿开发步伐。一份由 1300 名 AI 从业者签署的信件呼吁美国政府支持一项有意调控前沿节奏的国际行动。
模式十分清晰:离技术最近的人对它最警觉,而对部署拥有控制权的人却不在同一个房间里。
接下来会发生什么
未来几个月将决定这些警示是转化为政策,还是沦为表演性愤怒。一项多边条约是艰难的承诺。即便是经历了数十年准备的《巴黎气候协定》,也耗时多年才谈判成形。AI 的发展速度远超外交节奏。但另一种选择——等到危机迫使人回应——正是胡宾格和克森所警告的。
股市因素不容忽视。如果 Anthropic 和 OpenAI 都在近期上市,投资者将面临抉择:押注一家其 own 研究员称技术可能已失控的公司,还是等待。这种张力将在招股书、财报电话会议和股东决议中展开。它也将在监管申报中上演——因为认真对待琼斯信函的政府将开始提出任何投资者关系团队都无法用幻灯片糊弄的问题。
眼下,权力天平仍倾向于各大实验室。但泄密事件改变了算术。辩论已不再局限于实验室和会议厅——它进入了报纸专栏、财政部办公室和养老金基金的资产配置表。这才是真正的转变——而这,才刚刚开始。