business 10 分钟阅读

Claude曾是武器——首次记录在案的AI对抗AI入侵事件

研究人员利用Anthropic的Claude模型作为攻击向量,针对OpenAI的基础设施发起攻击——这是AI安全史上首次有记录在案的事件。该漏洞揭示了一种新型风险类别:当竞争对手的AI成为其无意的同谋。

  • Noam Shazeer
  • Anthropic
  • Claude Code
  • UAT-10147
  • AI vs AI

一个 AI 攻破另一个 AI 的门户

研究人员以 Anthropic 的 Claude 模型为主要工具,入侵了 OpenAI 的基础设施。此次攻击间接但巧妙:研究人员并未直接正面突破 OpenAI 的系统,而是利用了托管 OpenAI 社区论坛的第三方平台 Discourse 的一个漏洞。随后,他们横向渗透——窃取内部登录凭证,最终获取了一名 OpenAI 员工的 ChatGPT 账号权限,该账号通过后门可访问内部 GitHub 代码库。

OpenAI 证实了此次入侵,感谢研究人员的报告,并表示相关漏洞已修复。Anthropic 拒绝置评。负责该研究的安防公司 Hacktron 未予回应确认。

技术细节固然值得关注,但更深层的意义更为重大:有记录以来首次,一家公司开发的商业 AI 模型被用作打击其主要竞争对手的攻击载体。这并非人类将 Claude 作为提升效率的工具来辅助攻击的场景。研究人员让 Claude 充当了行动主体——那个在 OpenAI 环境内阅读、推理并执行操作的引擎。

入侵的实际路径

整个入侵链条始于一个配置错误或未打补丁的 Discourse 实例。论坛软件在科技公司中司空见惯,但在 AI 领域却承载着非同寻常的分量,因为这些面向公众的社区平台往往直接或间接地连通着内部认证系统。社区登录与内部凭证之间的这一关联,正是漏洞的藏身之处。

进入员工 ChatGPT 账号后,研究人员通过 GitHub 获取了内部代码。对一家 AI 公司而言,这几乎等同于踩进了核心机密库。源代码、内部工具、提示工程规范,乃至可能的训练数据引用,都经由此类代码库流转。此次攻击无需直接突破 OpenAI 的安全边界,只需攻入那扇公司向公众敞开的门:其社区论坛。

OpenAI 的应对——快速补丁与公开承认——表明入侵确实发生且已得到控制。然而,第三方论坛平台成为入口这一事实,引出了一个远超 OpenAI 自身基础设施范畴的问题。

为何不同于以往任何一起企业入侵

传统的商业间谍活动与安全入侵遵循着可辨识的模式:人类攻击者——或个人团体——编写定制漏洞利用代码、制作钓鱼邮件,或在地下市场购买访问权限。工具是人造的,意图是人驱动的,归属认定无论多么模糊,最终都可追溯至具体的人。

而在此次事件中,攻击工具是一个基于庞大互联网文本语料训练的通用 AI 模型——涵盖代码、文档、论坛、帮助线程、安全公告等——随后被部署用于在一个真实的商业环境中导航。Claude 并未被指示“编写恶意软件”或“窃取凭证”。它只是接到了一项任务,并用自身习得的推理路径将其解决。研究人员设定目标,Claude 提供方法。

这一区别至关重要,因为它正在重塑每家 AI 公司的攻击面。你不再需要雇佣红队操作员团队,或购买零日漏洞。你只需要接触一个能力出众的前沿模型,并提出一个假设:它的知识储备与目标基础设施的重叠点在哪里。

Anthropic 的内部数据让局势更显紧迫

此次披露正值 Anthropic 发布内部数据之际,数据显示,其自身研发工作中现在有 26% “由 Claude 主导”——而三月份这一比例仅为 1%。公司将此举定义为行业透明度建设,用以说明业界距离“递归自我改进”究竟还有多远,即 AI 系统开始在没有人类直接干预的情况下自主训练并迭代下一代自身的理论阈值。

Anthropic 强调,其模型目前尚未在任何已研究的任务中实现完全自主运行。在 90% 的任务中,AI 仍与人类“协作”,承担大量工作,但人类保留监督权。公司公开这些数据是为了帮助外界理解发展轨迹,而非宣称该阈值已被突破。

但轨迹本身就是关键。如果 Anthropic 自身的研发正日益由 Claude 驱动,那么 Claude 在代码导航、系统遍历和自适应问题解决等方面的能力,每天都在这家全球最具规模的 AI 机构内部接受压力测试。那些曾助力构建 Anthropic 下一代系统的模型,正是研究人员选择用于对抗 OpenAI 的模型。这并非巧合,而是算术。

谁赢谁输,以及接下来会怎样

直接的赢家是向外界揭示这些漏洞的研究社区。一次干净、公开、已修复的入侵,比隐秘的渗透更能赢得信任。OpenAI 的快速承认与补救固然专业,但同时也印证了攻击者的前提:差距确实存在,且可以被跨越。

输家则是那种以为可以沿用 Claude 出现之前的传统边界思维来管理企业 AI 安全的假设。当竞争对手的 AI 系统与你在同等的互联网规模数据上训练时,防守方与攻击方之间的不对称性会被大幅压缩。攻击者无需深入理解你的内部架构,他们只需要一个曾在某个网络角落接触过其碎片信息的模型。

接下来的走向,很可能是一种新型企业安全审查类别的诞生。所有运营具备 AI 能力产品的公司——不只是 OpenAI 和 Anthropic,而是任何将公共论坛与内部认证打通的组织,或任何利用 AI 助手进行代码与基础设施工作的团队——都需要自问:第三方集成是否已成为模型驱动攻击的潜在载体?问题不再是“谁在攻击我们”,而是“我们的工具能自主做到什么程度”。

护栏难题

Anthropic 拒绝就此次入侵置评。这份沉默本身便是答案。当一个模型——在特定的安全立场下完成训练、销售与治理——成为跨公司入侵的工具时,企业究竟该如何应对,目前尚无明显政策框架可循。当前的护栏机制聚焦于防止终端用户滥用:阻止模型生成有害内容、拒绝危险请求、应用内容过滤。但这些机制均未覆盖这样一种场景:合法用户将模型指向另一家公司的基础设施,而模型因未见任何阻碍理由便顺从执行。

这并非 Claude 单方面的缺陷,而是 AI 系统在评估跨组织风险时存在的结构性盲区。该模型并非被设计为武器,而是被设计为辅助工具。而在此情境下,这种“助人为乐”反而成了漏洞本身。

后续看点

通过 Claude 入侵 OpenAI 的事件,绝不会是 AI 模型被用于攻击另一家公司系统的最后一起记录在案案例。随着类 Claude 能力在更多组织中扩散并嵌入各类工作流,类似攻击的概率将持续上升。安全行业仍在摸索如何应对这一威胁类别。OpenAI 修补 Discourse 漏洞的事实并不能改变底层逻辑:当 AI 系统具备足以在商业环境中导航的能力时,辅助与入侵之间的界限会变得模糊,而传统安全工具本就未曾为此类情形设计检测机制。

研究人员已经证明了这一观点。现在的疑问是,整个行业能否跟上脚步。