technology 11 分钟阅读

Anthropic的Claude如何在72小时内被武器化以攻击OpenAI

一家安全公司在不到三天内利用Anthropic的Claude模型入侵了OpenAI的内部系统——这一强烈信号表明,最强大的AI模型正逐渐变为自主攻击工具,而不仅仅是企业助手。

  • Noam Shazeer
  • Anthropic
  • Opus 5
  • 关键基础设施
  • 开源权重模型

72小时漏洞:暴露AI的致命脆弱性

韩国一家网络安全公司披露了一则令所有运行AI驱动工作流的企业不安的消息:Hacktron的研究人员利用Anthropic的Claude模型,在不到72小时内攻入了OpenAI的内部基础设施。9月18日发布的这份报告,是首个公开记录的前沿AI模型在真实渗透测试中被用作武器的案例,而目标之一是地球上戒备最森严的组织之一。

详情勾勒出一个既令人警觉又发人深省的场景。Hacktron团队在OpenAI的公共帮助论坛中发现了一个漏洞——一个看似平常、却隐藏着认证绕过机制的入口。借此,他们获得了服务器访问权限,抓取了会话缓存中存储的员工凭证,并横向渗透进Monorepo——一个包含OpenAI最敏感算法数据的内部系统。他们留下了刻意的入侵痕迹:在一个只有内部工程师才能访问的目录中放置了一个markdown文件。OpenAI在数小时内确认了该漏洞,颁发了6500美元的漏洞赏金,并在通知后仅14小时便完成了修复。

这里的一切速度,才是真正的故事。从初始侦察到凭证窃取再到横向移动,整个操作不到三天。大多数企业级入侵需要技艺娴熟的人类操作员持续数周甚至数月的努力。而这发生的速度比典型的产品发布周期还快。

Claude如何成为武器

研究人员最初尝试用他们所称的"Opus 4.8"发动攻击来生成恶意代码,但失败了。提示词产出的脚本语法正确却功能残缺——模型会写代码,却无法编写有针对性的代码。他们切换到"Opus 5"——当时最新的Claude版本——几小时内便拿到了具备利用、侦察和横向移动能力的功能性攻击脚本。

这一转变至关重要。它揭示出,AI模型的目标用途(回答问题、编写代码、生成文本)与其实际能力(生成针对性利用工具)之间的界限,远没有业界公开承认的那样狭窄。Claude并非被设计为黑客工具。Anthropic的安全审查、红队测试协议和使用策略都未曾将此类场景纳入考量。但只要给出恰当的提示词,足够强大的模型就能生成执行跨内部系统多阶段入侵的代码。

Hacktron明确指出了这一差异。他们的人类研究员仅在操作上投入了几小时——打磨提示词、在失败中迭代、转向下一个方案。AI代理则花了数天时间完成繁重工作:生成利用代码、编写凭证窃取脚本、针对内部防火墙进行测试。其推论简单而无可回避:随着AI模型不断进步,执行复杂入侵所需的人工努力将趋近于零。成本曲线被翻转。过去需要六名高级安全研究员三周时间完成的工作,如今只需要一名分析师和一份模型订阅。

谁赢,谁输

OpenAI损失了声誉与信任。 Monorepo漏洞即便影响有限,也表明竞争对手的系统——或任何能访问足够强大AI的人——可以深入渗透。OpenAI在Greg Brockman的指示下不得不将其工程团队25%的人力重新调配到防御工作,突显了此类事件需要投入多少注意力。Brockman在Sam Altman短暂离职后重返CEO职位,将安全作为他的首要任务。这种重新调配代价高昂——无论是工程时间还是战略重心。每一次冲刺周期、每一项路线图承诺,都因应对入侵后果而被推迟。

Anthropic的品牌承受了复杂的冲击。 Dario Amodei长期主张放慢AI的开发节奏,警告称能力正超越安全实践。这一事件在一定程度上印证了他的谨慎——它展示了当模型进步速度超过安全生态系统适应速度时会发生什么。但同时也将Anthropic的产品描绘成AI驱动攻击的首选武器。其他所有实验室都会注意到,在本次对抗中Claude做到了GPT未能做到的事。竞争优势正在转移。每一个曾信任Claude处理内部工作流的企业都面临清算:他们的生产力工具已变成攻击面。

Hacktron赢得了信誉。 该机构展示了能力、负责任地披露并接受赏金。在安全研究社区,这是理想的操作手册。他们遵循了负责任的披露规范,公开沟通,并在发布前验证了发现。但他们也常态化了一个观念:任何有资金、能访问前沿模型的优秀团队都能复制这一行动。准入门槛降低了。过去需要内部知识和物理访问的工作,如今只需一份模型订阅和足够的提示工程技巧。

企业失去了安宁。 任何已将Claude、GPT或类似模型集成到内部工作流中的组织——尤其是处理凭证、源代码或敏感数据的组织——现在都有了这些工具如何被反制它们的实例。威胁不再只是理论。此事发生在地球上戒备最森严的两家公司之间。如果OpenAI的防线都能以此方式被突破,大多数企业环境就暴露得更加严重。让AI变得有价值的集成模式——将模型嵌入认证系统、授予它们访问内部API的权限、允许它们生成触及凭证的代码——正是让它们变得危险的同一种模式。生产力的架构,同时也是攻击的架构。

接下来会发生什么

这次漏洞揭示了AI安全领域一个结构性的空白,而业界仍在摸索如何应对。三大趋势将从此加速。

第一,AI驱动的攻击链将更快、更便宜。 72小时的时间线已经令人印象深刻。随着模型不断进步且更易获取,这一窗口将缩短。下一次此类攻击迭代可能需要更少的人工监督和更少的手动步骤。趋势指向完全自主的入侵系统——能够识别漏洞、生成利用程序、窃取凭证并跨网络横向移动而无需人工干预的模型。每次漏洞的成本将趋近于一次模型API调用的边际成本。

第二,OpenAI与Anthropic之间的竞争动态将在安全维度上加剧。 在该场景下,Claude在GPT力不从心时展现了有效性。预计两家公司都将公开加强自身安全态势,同时也会面临压力,需要审计其模型在被激进提示时会如何表现。军备竞赛不再仅仅是关于能力,更是关于韧性。哪家实验室能构建既抵御滥用模式又能交付价值的模型?答案将决定市场定位。

第三,监管和审计将紧随其后。 Amodei呼吁放缓开发速度的主张不太可能获得政治上的共鸣——竞争压力太大,经济激励太直接。但类似于欧盟在其《人工智能法案》中正在推进的针对前沿模型的强制安全测试,将推动各实验室认证其系统能够抵御此类滥用模式。认证要求将成为差异化竞争的关键。哪款模型能在抵御利用的同时仍能表现出色?

真正的启示

这次漏洞并非关于OpenAI疏忽的丑闻。它是关于当任何懂得如何提问的人手中掌握了AI模型时,这些模型能做什么的一声警钟。这些工具是通用目的的。结果却不是。

将AI集成到关键基础设施中的公司需要像对待任何高权限系统一样对待这些模型:严格的凭证管理、隔离环境、对异常行为的持续监控,以及定期的红队测试。时钟正在滴答作响。72小时漏洞是未来的一瞥——这不是一次性事件,而是地球上最强大工具被用于对抗其创造者所指向的结构性和根本性转变。

教训清晰而令人不安。我们打造这些模型是为了放大人类的能力。但我们没有让它们具备抵抗被向错误方向放大的能力。在我们解决这个问题之前,每一个让AI变得有价值的集成模式同时也让它变得危险。这次漏洞并非异常。它是一个示范。