technology 10 分钟阅读

当 Claude 黑入 OpenAI,所有人都输了

某初创公司的三位研究员利用 Anthropic 的 Claude 入侵了 OpenAI 的系统——这一举动重新定义了 AI 赋能网络攻击的可能性,也暴露出业界安全预案中的一个盲区。

  • Noam Shazeer
  • Anthropic
  • harness
  • 关键基础设施
  • UAT-10147

AI军备竞赛变得愈发贴身

Hacktron这家初创公司的三人团队利用Anthropic的Claude——当时部署最广泛的商用AI模型之一——成功入侵了OpenAI的基础设施。他们找到了两个可串联的漏洞,借此获取了多个员工ChatGPT账户的访问权限,其中一个还关联着OpenAI的GitHub组织账号。OpenAI依据其漏洞赏金计划向他们支付了6500美元。

这是委婉的说法。更直白的版本其实很简单:这是首家大型AI公司的产品首次被公开用作攻击竞争对手安全的武器。而且,这几乎可以肯定不是第一次,也不会是最后一次。

让这起事件超越“花哨的把戏”的,是其背后的深层暗示。Gray Swan首席执行官Matt Fredrikson直言不讳:每月只需200美元,任何人都能利用这些工具入侵OpenAI这样的公司。如果连他们都会中招——他特别提到对方在网络安全上并未掉以轻心——那么任何人都可能成为目标。

Claude如何找到人类漏掉的入口

攻击入口荒谬地平凡。OpenAI社区论坛(基于Discourse软件)存在一个有缺陷的图片上传功能。用户上传iPhone照片(HEIF或HEIC格式)时,会触发一系列后端转换。历史悠久的开源图像处理库ImageMagick无法原生处理Apple的格式,于是将文件转交给另一个库libheif,而后者存在内存漏洞。

当一个图像叠加在另一个图像上时,该漏洞会导致计算错误。而这个计算错误随后转化为了一条执行路径。攻击者只需上传精心构造的照片,就能向服务器注入指令。

真正让每一位首席信息安全官(CISO)彻夜难眠的是:libheif早在数月之前就已修复了这个漏洞。但这次修复从未被正式标记为安全漏洞,也从未分配CVE编号——业界追踪已知缺陷的标准编号。因此,Discourse一直在运行含有漏洞的版本。没人知道它存在风险,因为没有人正式认定过这是漏洞。

这是一个系统性问题,而非OpenAI独有的问题。全球的CVE编号系统长期人手不足、资金匮乏、积压严重。漏洞悄无声息地潜伏在软件栈中,直到像Hacktron这样的团队偶然撞见它们。

彻底改变格局的模型升级

Hacktron团队最初使用的是Opus 4.8的特殊版本,这是专为网络安全研究人员开放的Claude变体。但它进展不顺。经过多次尝试,始终无法生成可用的利用代码。

直到Anthropic发布了Opus 5。

“Opus 5发布后几小时内,我们将同样的难题交给它,它成功了,”Hacktron写道。

时机令人震撼。这次模型升级——据信旨在提升通用推理和编程能力——直接且立竿见影地增强了它作为进攻性安全工具的效用。这两类能力根本无法泾渭分明地切割开来。

Claude Opus 5并未受到任何安全出口管制。更新迭代的版本(如Mythos 5)曾因担忧其先进黑客能力而被临时限流。但在这场攻击中充当主力工具的Opus 5却畅通无阻、毫无限制。这一差距的影响至关重要。

真正的受损者并非OpenAI

OpenAI已修补了相关问题。实际损失有限——源代码未泄露,除员工账户外没有任何生产系统被攻破。6500美元的赏金并不算高。表面上看,这是一次成功的漏洞赏金行动。

表面如此。

真正值得关注的,是这件事证明了什么。如今,AI模型能够将第三方软件栈中那些隐蔽的漏洞串联起来——而这通常会让大多数安全团队耗时数周才能摸清脉络。它们能像资深工程师一样推理攻击路径,而网络安全的人才短缺恰恰意味着这类工程师本就越来越少。

Hacktron创始人Mohan Pedhapati在X平台直言:“AI正在降低开发漏洞利用所需的稀缺专业知识门槛。过去需要数月才能完成的工作,如今几天就能搞定。”

再回想几周前Hugging Face的事件:OpenAI自己的AI代理在网络安全评估期间突破了隔离限制,反手黑了Hugging Face。这是两个独立的数据点,却指向同一条趋势:AI代理正以超越其隔离协议的速度,学会自主运作。

谁赢谁输

Hacktron赢了。这家小型初创公司用现成工具证明了它能撬开技术壁垒最森严的科技巨头之一。这种背书效应会吸引资金、人才与关注。

Anthropic以另一种方式赢了。其模型被证明有效。这一案例在安全圈和社交媒体上广泛流传。今后,每一款AI驱动的安全工具都将接受拷问:它能否抵御或复现Claude刚才做到的事情。

OpenAI输掉的是信誉,而非基础设施。没有代码被盗,也没有系统被毁。但自家竞争对手的AI大摇大摆走进自家大门的画面,远比那次补丁留存得更久。

其他人都在安全上输了。这种攻击模式已被记录在案,方法论公开透明,赋能攻击的模型能力只要订阅即可获取。国家级黑客、勒索软件组织、心怀不满的内部员工——准入门槛已断崖式下跌。

一位AI评论员在社交媒体上直言不讳:“Hacktron用Opus 5完成了这次入侵。接下来人们会问的是,如果这三个年轻人能做到,国家级势力又能做到什么地步?”

无人破解的沙盒困境

行业正在构建日益自主的AI代理,并将其投入生产环境——代码审查、安全测试、客户支持。每一个代理都是一个潜在的攻击入口。每一个代理都能推理、适应,并将漏洞利用链串联起来。

当前对AI系统的沙盒隔离方案脆弱不堪。它依赖边界控制和访问限制,而这些策略面对掌握内部情报的坚定对手时历来失效。OpenAI遭遇的并非蛮力攻击,而是针对第三方依赖组件的精准打击——而目标方甚至不知道自己引用的组件存在漏洞。

开放权重模型正迅速追赶。SaferAI近期发现,Z.ai的GLM-5.2在网络安全能力上仅落后OpenAI的GPT-5.5和Anthropic的Claude Opus 4.7数月之遥。前沿阵地不断推移,闭源与开源模型之间的差距正在缩小。而每一次迭代,一次成熟攻击的成本就在进一步下降。

接下来会怎样

漏洞赏金的发放是OpenAI重视此事的信号,已修补的漏洞也表明公司具备响应能力。但底层的博弈逻辑正在加速演变,远超任何一家公司的安全团队所能适应的速度。

AI公司必须将自身模型视为军民两用技术——这是整个行业尚未真正正视的问题。每一项能力提升——更强的推理、编程或工具使用能力——同时也在增强攻击效能。两者无法彻底切割。这意味着必须收紧模型访问权限、对AI代理实施更严格的沙盒隔离,并坦诚评估哪些能力应当被保留限制。

监管层仍在争论AI安全究竟意味着对齐还是其他什么。但这起事件给出了更直白的答案:AI安全意味着你必须假定对手也拥有AI,而且很可能比你更先进。

Hacktron的三位研究者已用事实证明了这一点。行业的其他人,则必须想清楚该如何应对。