technology 11 分钟阅读

OpenAI在88小时内解决千禧年难题,数学或将永远改变

OpenAI声称其未公开模型在短短88小时内解决了纳维-斯托克斯存在性与光滑性问题——这是克莱数学研究所千禧年大奖难题中的第二道,也是第一道被机器攻克的难题。数学界在欣喜与震惊之间分裂。

  • KakaoAI
  • Noam Shazeer
  • 伽罗瓦逆问题
  • Lean
  • AI数学
  • 陶哲轩

时钟走到了88小时。数学界屏住了呼吸。

9月8日,OpenAI宣布其一款未公开的内部模型在三又三分之一天内解决了克雷数学研究所(Clay Mathematics Institute)七大千禧年大奖问题之一——纳维-斯托克斯存在性与光滑性问题。该证明及验证过程长达165页,消耗了约1300亿个token,由大约10000个AI智能体协同完成。费用虽未公开,但考虑到专用推理芯片的电力需求,以百万美元计的可能性极高,只能留给读者自行想象。

有两点细节使这一事件格外非凡。首先,纳维-斯托克斯问题并非一道藏有精巧技巧的谜题。它追问的是:描述流体运动——从天气系统到血液流动——的方程,是否在任何初始条件下始终存在光滑解?换言之,流体是否会自发产生无限速度?自2000年约翰·克雷二世设立这项挑战以来,尚无人类数学家给出定论。

其次,且影响更为深远的,是其解决方式。这并非一位孤独的数学家在黑板前苦思二十年的成果,而是一套专为规模化、并行化和机器级迭代而设计的系统的产出。

被攻克的其他千禧年难题——庞加莱猜想——于2003年落定,其解出自俄国数学家格里戈里·佩雷尔曼之手。这位隐士般的学者近乎独自作战,在前人数十年几何分析的基石上继续推进。佩雷尔曼的证明仍须经数年的人类同行评议才能确立。而AI生成的纳维-斯托克斯证明却以"先提出、后验证"的顺序呈现,将原本需耗时数十载的过程压缩至数天。操作顺序已然颠覆。

谁赢谁输

最直接的赢家,是掌控算力的那一极。OpenAI高调展示了一台未公开模型在88小时内并行调度10000个智能体的壮举。这种基础设施成本高昂且高度集中。如果这一成果立得住——而关键的限定词正是"如果"——那么能够负担此类蛮力数学搜索的机构与其他机构之间的鸿沟将急剧扩大。无法获得同类硬件的大学,将沦为追赶那些由资金充裕的实验室生成之证明的后尘。发现的经济学逻辑就此改写。

次要的赢家,则是所有因应用数学进展加速而受益之人。纳维-斯托克斯方程是计算流体力学的支柱。关于全局正则性的严格证明——无论肯定与否定——都将重塑湍流建模、气候模拟、空气动力学设计以及无数工程领域。即便是一条不完美的求解路径,也可能让实际研究提前数年取得突破。

最难以命名的输家,是一种抽象之物:数学理解中那种缓慢、审慎、充满人性质感的纹理。泰伦斯·陶,被广泛认为是当今最杰出的数学家、任教于加州大学洛杉矶分校,曾公开警告AI可能侵蚀人类对其所解决之问题的真正理解。在陶的表述中,千禧年问题如同灯塔——它们集中学术力量、吸引人才,并产出超越原始问题本身的洞察。如果机器能在不走过人类同样思维路径的情况下解决这些问题,灯塔依然闪耀,但学会循其导航的人却越来越少。

无人能绕过的同行评议关

故事从宣告走向裁决的地方,就在这里。数学界不会仅凭博客文章就认可一项成果。这165页的证明必须经受与佩雷尔曼手稿同样的 scrutiny——后者历经数年审查,甚至一度因主张看似不完整而濒临坍塌。评审者将逐字逐句核查每一步,尤其关注任何依赖于AI中间推理链、而非清晰陈述的引理的那些步骤。

一个重大障碍在于:这份证明由一个部分基于Lean训练的系统生成。Lean是一种定理证明语言,最初为人类数学家设计,要求每一次逻辑推论都必须显式写出。这听起来对验证极为理想,但也意味着AI必须将直觉性的飞跃转化为可机械核验的形式。如果这165页的文档中包含伪装的常规步骤中的漏洞——这在前此的AI生成证明中是已知的脆弱点——结果将即刻失效。如果它通过检验,它将成为首个主要由算法过程解决的千禧年问题证明。

重塑一切的Anthropic竞逐

比证明本身更意味深长的,是时机。OpenAI宣布的前一天,纽约大学数学家特里斯坦·巴克马斯特公开了他同期的并行工作。这位曾在社交媒体上透露正与Anthropic的一位研究者合作类似问题的学者,其消息随后被OpenAI自己的博客所引用——后者承认,公司在得知竞品存在后决定集中资源,同时坚称未曾审阅Anthropic的方案。

这一声明暗流涌动。它暗示两家资源雄厚的实验室正同时逼近同一个开放问题,各自将其视为竞争性的冲刺而非共同探索。双方直至被逼无奈才彼此引用。由此浮现的叙事,不再是数学作为协作,而是数学作为军备竞赛——算力即弹药。

为何意义超越问题本身

纳维-斯托克斯的主张嵌在一个更大的模式中。今年早些时候,OpenAI与初创公司Harmonic宣布了一项AI解决方案,攻克了保罗·埃尔德斯长期提出的一个组合数学问题。那项成果范围较窄。纳维-斯托克斯则难出数个数量级,且其名称旁附带一百万美元奖金。雄心的跃升是刻意的。

它所传递的信号是对时间表的修订。十年前,大多数数学家的共识是:AI或许能协助猜想生成或小型证明,但要撼动千禧年问题?绝无可能。去年,这一共识转向" unlikely but possible(不太可能但有可能)"。今天,在经历了88小时的真实时钟运行后,它或许需要再次转向:“我们本该预料到这一天终将到来。”

一个令人不适的推论是,证明发现的门槛已从深厚的领域专长转变为大规模系统的准入资格。一位手持粉笔、面对黑板的优秀博士生,曾经对千禧年问题拥有一线胜算。如今,门槛还包括了任何单一大学系所都无法匹敌的算力预算。AI的民主化幻想——以为它能拉平赛场——原来是选择性的。它拉平的是组织的水平,而非个人的。

无人沉默的安全维度

AI安全社区多年来一直警告能力升级超越对齐的紧迫性,如今却面临一个更尖锐的问题:如果一个模型能解开千禧年问题,在它被要求做什么之前,它还能做什么?风险不在于纳维-斯托克斯的证明有误——尽管它很可能确有错误——而在于先例正在使一种做法常态化:将越来越强大的系统部署于其输出无法被充分审计的问题之上。

陶关于人类理解力衰退的担忧是这种焦虑的一脉。另一脉则更为朴素:我们可能过快将AI生成的证明奉为权威,跳过验证,只因"亲自花数年攻克一道题"的选项,当一家实验室能在数天内交付答案时,显得愈发不可持续。激励机制奖励的是速度,而非深度。

接下来会发生什么

如果同行评议验证了该证明,OpenAI的主张便成为历史。千禧年大奖委员会将宣布正式评估流程。一百万美元奖金变成现实。数学与机器的关系从此永久改变。

如果证明失败——而在早期的AI生成数学中,失败司空见惯——这一事件依然意义重大。它证明尝试本身是可行的。它确立了一个基线:88小时,10000个智能体,1300亿token,165页。未来系统将以此为基准。无论结果如何,轨迹已清晰可见。

英语世界除韩国之外的读者,可能错过的一个要点是:这一消息在一个通常不引领全球AI新闻周期市场落地的紧迫程度。韩国Newsis抢先于美国主流媒体报道此事件,恰恰凸显了这些进展有多么交织紧密、节奏多么迅疾。这场竞赛是全球性的。其影响不受任何单一国家研究社区的边界限制。

时钟八十年前就已开始走动。只是这一次,它走得更快了。