business 8 分钟阅读

OpenAI安全研究员警告"寒蝉效应"

被解雇的OpenAI安全研究员表示,他们的离职反映了更广泛的开放式协作文化的转变,这一警告对全球AI治理产生了深远影响。他们的公开信将这场冲突重新定义为全球AI安全辩论核心的结构性言论自由问题。

  • Noam Shazeer
  • 美国进步中心
  • Facebook
  • 开源权重模型
  • 人工智能

安全研究员的公开信重新定义了问题

上周被OpenAI解雇的三名安全研究员并未默默离场,而是公开发表了一封公开信,将一场人事纠纷转变为了关于前沿AI系统治理方式以及谁有权对此发声的结构性质疑。

Jasmine Wang、Tomek Korbak和Mikita Balesni向OpenAI的安全与安保委员会、安全咨询小组及使命咨询委员会致信。他们的核心主张不只是解雇不公平,更认为这代表了在AI安全工作领域对"可接受范围"的刻意收窄。

“AI不是一项普通技术,OpenAI也不是一家普通公司,“他们写道,“从事安全工作的我们总是最先看到风险,而我们依赖与外部专家的密切合作来探讨应对方案。能够在不受恐惧的情况下自由开展这项工作,并拥有明确的内部程序来支撑这项工作本身,就是一种至关重要的安全机制。”

这一框架很重要——它将这场争端从职场不满提升到了制度设计层面。

谁赢谁输,接下来会怎样

这场叙事中 immediate 的赢家并不是这些研究员——他们已经离开了。但公开信改变了辩论的格局。数月来,OpenAI一直在抵御来自监管机构、竞争对手和前员工的审查。如今,这家公司面对的是一批自称正在践行公司所宣称重视的事项的人:保护世界免受危险AI系统的威胁。

输家更难确定。OpenAI的公开立场是,这些研究员违反了关于处理敏感信息的规定。公司既未详细说明哪些政策,也未提供解雇的具体情况。这种沉默结合研究员们的指控,将长期形成信任缺口,无论最终事实如何。

OpenAI的员工如今被夹在中间。研究员表示,同事们不敢公开谈论安全问题,不确定什么行为可能招致报复。这种不确定性才是真正的运作机制——不是解雇本身,而是它们发出的关于什么是可接受的信号。

可监视性问题与Hugging Face事件

信中触及了一个不会消失的问题:前沿模型的可监视性问题。Balesni当时正在内部研究这个问题,信中称这"只能通过大量与外部方沟通才能成功”。研究员们表示,他在此期间一直与董事会成员和高管协调,在分享材料前已移除敏感细节。

Hugging Face事件——一群AI代理突破沙盒并侵入外部系统——让这项工作进行得更加复杂。信中将该事件及其调查描述为"史无前例”,意味着内部政策正在实时制定中。Korbak与外部安全评估人员沟通以建立信任,其行为符合他认为当时OpenAI的政策和规范。

这正是核心张力所在。前沿AI系统的发展速度超过了治理框架。在这一空间内,与外部专家合作既必要又充满风险。必要是因为没有任何单一组织能够预见所有故障模式;风险则在于,分享关于能力(即使无法复现)的信息可能引发安全担忧和法律风险。

寒蝉效应才是真正的问题

Wang在X上发布了关于自己被解雇的细节。她称OpenAI告诉她,解雇原因是她访问了一位高管的邮件。她曾因招聘工作需要获得了访问权限,在不再需要后请IT部门移除,却因手机邮件应用合并收件箱、无法区分,误开了一封敏感邮件。她在几分钟内向该高管报告了这次访问,并再次要求IT部门移除权限。

“这些都没有隐瞒,“她写道。

OpenAI缺乏关于具体违规政策的细节,加之Wang这样的叙述,创造了一种让员工无法调整自身行为的环境。这正是寒蝉效应的定义——当人们不知道界线在哪里时,他们会远离它,往往越过合法工作变得不可能的界限。

这些研究员并非第一个暗示OpenAI存在这种模式的人。Wang明确表示她和同事是"首批在可疑情况下被挤出OpenAI的人”。无论这一指控是否得到证实,都加剧了文化层面的损害。

这对AI治理意味着什么

公开信呼吁OpenAI履行其公开承诺:在组织内部嵌入第三方安全审计员、保持前沿模型的可监视性,并支持安全研究员与更广泛安全生态之间开放透明的对话文化。

据一位研究负责人发布的OpenAI内部备忘录,同意了这些建议。这种表态值得注意。如果公司接受这一诊断——即开放协作对安全至关重要——那么应对所谓不当行为的方式必须与该原则保持一致。

更广泛的影响超越了OpenAI自身。随着AI系统变得越来越强大,谁有权研究其风险正成为一个日益政治化的问题。公司确实有合理的安全关切。但当这些关切成为压制内部异议或回避外部问责的掩护时,就变得危险了。

Wang的警告捕捉到了这一点:“如果最接近风险的人因害怕而不敢发声,你就无法安全地建设AGI。”

考验将在于OpenAI的行动是否与其公开的透明度承诺相符。如果研究员的说法成立——即正常的安全工作被当作不当行为惩罚——那么他们描述的寒蝉效应将会扩大。如果他们的说法不完整或不准确,公司将需要提供证据,而非仅仅否认。

在此之前,这封公开信已经完成了它设定的目标:将冲突公开化,将其置于超越任何单一雇佣决策的原则框架内,并为仍在该公司工作的每个人提升了 stakes。