technology 8 分钟阅读

当ChatGPT和Claude同时宕机,警报应当真正拉响

9月3日,ChatGPT和Claude在同一小时内相继宕机,暴露出一个不愿承认的脆弱点:全球AI基础设施的实际集中程度远超想象。单一故障即导致多个平台同时下线。

  • Anthropic
  • 云基础设施
  • harness
  • Opus 5
  • ChatGPT
  • Azure
  • 云基础设施

一个无人会遗忘的周三

9月3日上午10点20分(美东时间),ChatGPT开始卡顿了。用户输入提示,然后等待。一些人收到了错误信息,另一些人只得到了一半就戛然而止的回复片段。到上午11点,Downdetector上仅美国一国就已录得约37,000份宕机报告。AI编码工具Codex也同时掉线。

几乎同一时间,Claude陷入黑暗。紧接着Grok也断了线。Cursor——xAI近期重新命名的编码助手,现已并入其母公司——也闪烁后熄灭。据报道,谷歌的Gemini也有一部分用户遭遇离线,但谷歌从未发表正式声明。服务在中午前后开始恢复,OpenAI于下午早些时候确认问题解决,Anthropic则在美东时间中午12:16宣布应用紧急补丁后全面恢复。

颇具讽刺意味的是,OpenAI在同一天宣布了其下一代模型Astra。

时间上的巧合而已。但四家主要AI服务——横跨OpenAI、Anthropic、xAI以及潜在的谷歌——在同一两小时窗口内接连跌倒,这绝非巧合。

隐藏的共享层

没有一家公司确认事故的根本原因。OpenAI、Anthropic和xAI均未发布技术事故报告。最合理的推断线索来自中断的重叠:微软Azure。据报道,Azure在同一时段也出现了自身问题。Azure托管了Anthropic的大量基础设施,也是OpenAI的主要云合作伙伴。这种重叠并非偶然——而是结构性的。

这正是大多数AI报道所忽略的不适真相。行业将自己呈现为一个多元竞争的市场:OpenAI、Anthropic、谷歌、xAI、Meta——所有模型相互竞争,各自独立。然而现实中,它们都在一层薄薄的共享基础设施上运行。同样的数据中心。同样的网络路径。同样的电网。当这一层的某一个环节出现故障,被带倒的不仅仅是一个应用,而是一整条生成式AI栈。

这正是困扰云计算领域十年的集中度风险。AWS和Azure已经引发过广泛感知的中断——2021年的AWS故障同时让Slack、Disney+和无数其他服务下线。不同的是,AI已经从便利层升级为运营层。

从新奇事物到关键基础设施

三年前,ChatGPT宕机意味着你无法生成一首诗或调试一段脚本。今天,它意味着一个客服团队失去了核心分级工具,一个软件团队无法执行自动化代码审查,分析师的文档流水线陷入停滞。AI智能体——无需人工干预即可将多次工具调用串联起来的系统——是最新的升级。它们不再只是回应提示词,而是在电子邮件、数据库和内部系统之间执行多步骤工作流。一旦智能体撞墙,它不会礼貌地暂停,而是留下未完成的事务、悬空的队列和挂起的流程。

这一转变真实存在且正在加速。企业AI采用已从实验阶段迈入集成阶段。各公司正将模型直接对接生产系统。依赖曲线的陡峭程度正超过弹性工程的进展速度。

备选方案的幻象

事故之后的行业应对已经初现轮廓。多模型策略被大力推广为解决之道。思路很简单:默认将请求路由到OpenAI,但如果某家供应商宕机,则故障转移至Anthropic或谷歌。一些公司正在构建AI网关,实时监控跨模型响应时间和可用性,并自动重新路由流量。

从纸面上看,这很合理。但在实践中,它有局限。

故障转移的前提是下游问题仅限于某一家供应商。但如果故障存在于共享云层——比如Azure是那个共同因素——那么将流量切换到运行在同一基础设施上的另一模型,毫无意义。多模型策略只能让你免受特定供应商的故障影响,却挡不住基础设施层面的-wide崩溃。这一区分意义极大,却鲜有人道明。

即便故障转移奏效,也会引入延迟。依赖亚秒级响应的智能体会损失效率。基于特定模型API行为构建工作流的团队,在切换时会面临集成摩擦。而维持跨供应商冗余模型访问的成本也不容小觑。

接下来会发生什么

几件事大概会接连发生。首先,这一事件将加速围绕AI基础设施弹性的讨论,但对话可能仍停留在应用层——多模型路由、负载均衡、重试机制——而非直面底层的集中度问题。这对各参与方而言都是更省力的政治路径。

其次,那些构建了AI依赖工作流却毫无冗余计划的企业将面临清算。这次宕机时间很短——对大多数用户而言大约两小时。但如果是六到十二小时的极端场景,影响将是可测量的:违约的SLA、搁置的部署、沮丧的员工。那些把AI视为可选工具的组织会很快明白这一点。

第三,监管机构或许会注意到。欧盟的《数字运营弹性法案》(DORA)及类似框架已经要求金融和关键领域企业证明其抵御技术故障的韧性。当AI中断影响到核心业务功能时,这类事件最终可能被纳入上述监管要求,尤其是当AI智能体从辅助走向自动化之时。

9月3日的宕机是短暂的。而这正是它作为警示而非灾难的价值所在。如今承载如此多全球AI流量的基础设施,与它所需规模相比仍然微小。集中度是速度的代价——它让模型训练更快、更新推送更快、扩展成本更低。但它也是一个等待被触发的单点故障。

当ChatGPT和Claude同时陷入黑暗,真正的故事并非宕机本身。而是提醒我们:AI革命所立足的地基,远比看上去更薄。