GPT-6 Astra 背后的十万 GPU 军备竞赛
OpenAI 的 GPT-6 Astra 需要 10 万块 NVIDIA GPU 进行训练——黄仁勋称这一规模很快将翻四倍。这组数字揭示了为何 NVIDIA 的统治地位既是助力,也是下一波 AI 推理飞跃的瓶颈。
那个重新定义一切数字
两年前的十万张 GPU 堪称空前。而今天,十万张已成为前沿模型的基准线。
9 月初,OpenAI 发布了 GPT-6 Astra,先面向精选机构,再向公众开放。它在不到 24 小时真实时间内通关了《Portal》(折合游戏内时间不到两小时),并在自主游玩 15 小时后破解了《RimWorld》——期间自行阅读攻略、搜索网络。这些是生动的演示。但真正的头条数字却更安静、也更深远:训练期间在线的 NVIDIA GB200 NVL72 单元超过 10 万张。
Greg Brockman 在 Stratechery 的采访中确认了这一点。这是史上首次有模型以如此规模完成训练。黄仁勋随后在 X 平台上更进一步,宣称 AGI 已至,且 40 万张 GPU 已在路上——算力一步翻了四倍。
这条轨迹才是故事本身。通关游戏并非重点,游戏只是新闻稿;GPU 数量才是权力格局的重塑。
为何 Looped Transformer 比头条更重要
Astra 采用了 Looped Transformer 架构——这是对自 2017 年以来一直主导领域的主流前馈注意力模式的结构性变革。Looped 设计在不同层之间循环复用中间表征,意味着你可以在不线性扩大参数规模的前提下加深推理能力。理论上这是一次效率优化。实践中,它解释了另一个关键问题:为何在 10 万张 GPU 上训练如此重要——这种架构需要在收敛之前以海量并行算力快速迭代那些循环链路。
这是英文报道几乎未触及的隐蔽细节。Looped Transformer 并非一个空洞的流行词。它标志着前沿正在从"在同一架构上堆更多参数"转向结构性重新设计——而结构性重新设计需要能够承载巨大训练负载而不碎裂的基础设施。目前只有 NVIDIA 的 NVLink 拓扑结构和 GB200 NVL72 机架级设计能做到这一点。这绝非偶然。
NVIDIA 的霸权即是瓶颈
这里存在一个令人不适的悖论:NVIDIA 的硬件霸权同时是进步的引擎,也是进步的约束。
每一家主要实验室——OpenAI、Anthropic、Google、Microsoft,以及越来越多国家级玩家——都需要同一样东西:GB200 NVL72 系统。但它们的生产速度远不能满足需求。交货期长达数季度。二手市场上 RTX 5090 消费级显卡的价格已经飙升,而这只是供应链末端渗入消费市场的冰山一角。
当黄仁勋说 40 万张 GPU 即将到来时,他描述的是一条必须扩张四倍的供给曲线。问题是,物理层面的约束——HBM 内存、CoWoS 封装、电力供应、数据中心机房空间——能否跟上步伐?每一个约束都将成为决定下一代模型能力的关键闸门。
这就是 NVIDIA 的地位为何既是其作为生态系统最大的资产,也是最大的软肋:如果你是唯一的路,所有抵达顶峰的人都会感谢你——而所有无法到达的人都会归咎于你。奖励暴力算力的扩展定律,同时也奖励控制暴力算力的人。这是一种危险的集中。
谁赢谁输
赢家一目了然。OpenAI 拥有一个能够在复杂游戏世界中自主导航的模型——这项能力可直接转化为工具调用、编码和类智能体工作流。NVIDIA 出售它并不在模型层与之竞争硬件。Microsoft 同时投资两者,并将一切接入 Azure。
输家则较难察觉,但结构上真实存在。无法获取 10 万张 GPU 集群的小型实验室将进一步落后。“前沿"与"其余一切"之间的差距,不再仅由人才或算法来衡量——而是由机柜空间和电力合同来衡量。无法获得足够 GPU 供应的国家将面临一种新型的的技术依附关系。
还有一个更安静的输家:消费级 GPU 市场。正如原始 Game*Spark 文章中日本网友评论所示,RTX 50 系列的价格已经扭曲。内存短缺确实推高了价格——部分源于地缘政治动荡——但结构性拉动 AI 训练需求的深层力量才是根本。当一款模型就需要 10 万张高端 GPU,留给其他人的残余供应便变得极为稀薄。
接下来会发生什么
直接的后果不是又一项基准成绩的突破。而是算力军备竞赛本身的加速。
如果 10 万张 GPU 将你带到了 GPT-6 Astra,而 40 万张已经在路上,那么下一代模型不会是渐进式升级,而是自主能力的全新量级——不仅是解游戏,而是以与熟练人类玩家难以区分的方式在游戏中运作。《RimWorld》的案例意味深长:模型只被告知"自己搞定”,随后生成策略、收集信息,并在 15 小时内执行完毕。这不是模式匹配。这是规划。
第二个后果是整合加速。无法访问如此规模算力的实验室,要么与拥有算力的云提供商合作,要么合并,要么专注于更狭窄的应用场景。“AI 公司"的定义正在收窄为"拥有前沿规模算力访问权限的公司”。
第三个后果——也是大多数人尚未讨论的——是扩展定律本身可能触墙。更多 GPU 能买来更多训练 token,但推理能力的边际收益递减是真实存在的。Looped Transformer 的尝试表明行业知晓这一点:他们试图在每个算力周期中获取更多智能,而非仅仅增加周期数量。这种做法在 40 万张 GPU 上能否奏效,仍是一个开放问题。黄仁勋对 AGI 已至的笃定,值得接受完全相同的待遇:用实际交付的东西来检验这份笃定。
需要关注的数字
10 万是门槛,40 万是预测。真正需要追踪的数字是新 GPU 产能与新模型能力之间的比率——因为如果该比率呈下降趋势,我们仍处于高效扩展轨道上。如果该比率趋平,下一次跃升将需要硬件之外的东西。那时,架构之战——Looped Transformer、稀疏混合、状态空间混合体——将不再是学术练习,而是生存策略。
当下,NVIDIA 手握杠杆。这既是一项成就,也是一道警示。