一名黑客如何利用 Anthropic 的 Claude 入侵 OpenAI
Hacktron AI 仅花费不到 3,000 美元的 Claude API 费用,便开发出一种级联漏洞利用工具,从 Discourse 论坛一路蔓延至 OpenAI 的内部 GitHub 代码库——暴露出一类新型攻击:竞争对手的模型本身就能成为武器。
AI 已成为武器本身
名为 Hacktron AI 的研究团队花费不到 3,000 美元的 Anthropic API 额度,就突破了 OpenAI。这是 headline 数字。更为不安的细节在于他们是如何做到的:他们让 Claude——Anthropic 自己的模型——协助编写漏洞利用代码,而 Claude 照做了。
这次攻击是一个新型攻击向量范本级的案例,而 AI 行业对此几乎还没有开始讨论。这不是提示词注入(prompt injection),也不是数据投毒(data poisoning)。它更简单,也更持久:利用竞争对手的公开 AI API 作为一个能干、不知疲倦的研究助手,来发现和利用你基础架构中的漏洞。
攻击链,逐步骤解析
Hacktron AI 从 Discourse 入手——这是驱动 OpenAI 开发者社区的开源论坛软件。Discourse 依赖一个名为 FastImage 的库来进行图片验证,而 FastImage 不支持 HEIF 格式。因此 Discourse 回退到使用 ImageMagick 的 magick 命令来处理这些文件——这个依赖项正如 Hacktron AI 报告的那样,使底层解析器暴露在攻击者可控的内容之下。
研究人员让 Claude Opus 4.8 审计已安装的 libheif 包是否存在安全问题。Claude 发现某些安全补丁未被移植回来。这一漏洞产生了堆缓冲区溢出,使得在 HEIC 图片解码过程中发生越界读写——这是远程代码执行的经典配方。
在此基础上,Hacktron AI 利用 Claude Opus 4.8 针对禁用 ASLR 的 x86-64 环境开发了漏洞利用代码。当此路不通时,他们转向新发布的 Claude Opus 5,让它将漏洞利用代码适配到 OpenAI 运行中的具体 Discourse 配置。Claude 照办了。最终成果是一个可行的图片上传漏洞利用,实现了本地远程代码执行。
从论坛到单体仓库
在 Discourse 实例上获得远程代码执行能力后,下一个目标是身份认证。该论坛使用的是 OpenAI 的单点登录(SSO)。攻破论坛就意味着能攻破所有通过该 SSO 关联的用户账户——包括连接到 Codex(OpenAI 的 AI 编程助手)的员工账户,进而包括公司的内部 GitHub 仓库。
Hacktron AI 劫持了一名 OpenAI 员工的 Codex 账户。该账户可以访问 OpenAI 的内部单体仓库(monorepo)。研究者在仓库中留下了一条消息以确认入侵,随后停止行动。没有数据外泄,没有蓄意破坏。只有访问权证明,通过本应保护他们的系统送达。
他们通过 OpenAI 的漏洞赏金计划报告了该漏洞,并获得 6,500 美元的奖金。OpenAI 公开确认了该报告。此漏洞现已修补。
这对行业的意义
Hacktron AI 最重要的一句话根本不是关于 Discourse 的。而是:这个漏洞并非 Discourse 特有。它是一个 SSO 问题。任何使用 OpenAI 认证的第三方或第一方服务,都能通过同一扇门进入。Discourse 只是他们选择用来演示整条攻击链的入口。
这之所以重要,是因为这次攻击花费了 3,000 美元的 Claude API 代币,不需要 Anthropic 侧的任何零日漏洞,不需要内部威胁,也不需要物理接触。被用来攻破 OpenAI 的工具,正是其竞争对手出售的产品——而 Claude 并没有拒绝帮忙。
我们正进入一个时代,每个公开 AI API 都可能成为攻击者的力量倍增器。资金充足的研究人员现在可以按代币租用世界级的推理引擎,并将其应用于发现与那个 API 生态系统的任何系统的安全弱点。准入门槛已从"需要深度漏洞开发专业知识"崩塌为"有一张信用卡和一条提示词"。
谁得利,谁受损
OpenAI 在此损失了信誉,尽管实际的财务和运营损害微乎其微。重要的是画面:一个竞争对手的 AI 帮助某人走进了他们的内部代码库。这个画面会比补丁活得更久。
Anthropic 从这次事件中没有任何直接收益——没有荣誉,也没有他们主动寻求的曝光——但此次事件悄然证明了 Claude 在技术推理方面确实有效,而这种推理能力既对防御者有价值,也对攻击者有价值。如今每家将 Anthropic API 整合进自己产品的公司都应该问一问:这种整合是否创造了一种间接的攻击面。
Hacktron AI 赢得了漏洞赏金,以及一个将重塑安全团队对 AI 辅助渗透测试思考方式的演示案例。他们的方法论——利用目标自身的生态系统工具来对付他们——是可复制的。
接下来会发生什么
我们预计这类模式会 proliferate(扩散)。其他拥有 SSO 关联服务、公开 API 和开源依赖的公司将发现自己处于同一剧本的攻击之下。3,000 美元的花费是下限,不是上限。随着模型进步和价格下降,发动此类攻击的成本将趋近于零。
安全团队需要将竞争对手的 AI API 视为攻击者会合法使用的一类工具——就像他们对待公共代码搜索、自动化漏洞扫描器和云成本估算器一样。防御手段不是封锁 AI 访问,而是加固面向公众的服务与内部系统之间的边界,实施严格的 SSO 隔离,并假设:任何能通过精心提示发现的漏洞,都能被已经完成提示步骤的攻击者发现。
OpenAI 的漏洞赏金计划完成了它的职责——将一次入侵转化为付费修复。但真正的教训是:补丁是必要的,但也是不够的。它所揭示的攻击向量不会消失。