OpenAI数学难题破解耗资4000万美元——但可能不算数
OpenAI称其智能体在消耗10,000个并发智能体、耗资约4000万美元计算后,破解了纳维-斯托克斯千年大奖问题。但两位顶尖数学家表示,通往该解的路径直接贯穿了他们未发表的研究数据——这让人们不禁要问:这究竟是证明,还是昂贵的插值?
证明的代价
周二,OpenAI表示其AI代理已解决了纳维-斯托克斯方程——这是七个千禧年大奖难题之一,令数学家们困惑了数十年。克莱数学研究所为正确的解悬赏100万美元。OpenAI的团队称他们找到了答案。
代价令人震惊。一万名并发AI代理工作了88小时,交换了270万条消息。另有17小时用于验证。据LLM基准评估机构LisanBench估算,仅输出token一项——按OpenAI平均消费价格计算——就约需650万美元。若计入体量更大的输入token,总成本可能高达1000万至4000万美元。山姆·奥特曼在X平台上被问及此事时,打趣地说人工智能是一 bubbles。
但这些数字并没有道出全部真相。真正重要的不是花费了多少——而是他们如何抵达终点。
声称被使用的数学家
两位研究者——特里斯坦·巴克马斯特(Tristan Buckmaster)和莱文特·阿尔波格(Levent Alpöge)——立即提出了一项超越技术挑刺的担忧。他们说,OpenAI的训练数据中包含源自他们关于相关问题已发表和未发表工作的去标识化信息,包括聚类猜想。该公司并未否认。它仅表示无法排除来自使用OpenAI产品的用户的数据(可能包括关于他们研究的对话)帮助改进了生成该证明的模型。
换言之,OpenAI走向答案的道路,可能在某种程度上建立在那些花费数年试图到达那里的人的智力劳动之上。该公司坚称它无法直接访问他们的未发表作品。但当你在百万级用户产出的聚合数据上进行训练时,直接访问与间接摄取之间的界限几乎可以忽略不计。
纳维-斯托克斯为何如此困难
这些方程描述了流体如何运动——机翼上方的空气、管道中的水、动脉里的血液。它们写起来很简单。求解却异常残酷地困难。关键问题在于:光滑解在三维空间中是否始终存在?还是会出现奇点——速度变为无穷大的点?没有人能证明任何一种可能性。
一个正确的解将变革流体力学、气候建模、航空航天工程以及无数依赖预测流动现象的领域。一个错误的解,披上数学语言的外衣,不过是昂贵的词藻拼贴。
这正是AI为纯数学带来的张力。系统能产生看似形式化的内容。它生成引理、推论、定义。它遵循证明的形态。但问题——数学家真正关心的问题——是这些步骤是否有效。不是听起来是否正确。不是是否见过类似的东西。而是它们是否成立。
这是证明还是表演
发现一个结果与验证一个结果之间存在结构性差异。AI在首部分至少当首部分意味着生成看似合理文本时表现得极其出色。它是否擅长第二部分则尚不明确——后者需要将每一步与模型可能并不真正理解的公理进行对照检查。
OpenAI记录的105小时对于协调问题而言令人印象深刻。但对于数学证明而言,未必如此。17小时的验证时间同样值得审视。谁进行了验证?其他AI代理,还是人类数学家?如果是前者,那就是系统在检查自己的工作。如果是后者,你应当听到那些数学家的声音。OpenAI尚未公开该证明供公众审查。
这之所以重要,是因为纳维-斯托克斯难题抵抗的不仅是不懈努力,还有一种特定类型的创造力。它需要任何模式匹配都无法替代的洞见。用计算机科学的语言来说,它需要一种新的原始概念——一种关于偏微分方程的思考方式,而这种方式根本不存在于现有文献中。问题在于,模型是找到了那个原始概念,还是组装了一堆现成概念的拼贴画。
二阶影响是真实的
即使该证明最终被证实有误,这一事件也揭示了该领域正走向何处。在几个月内,一个AI系统尝试解决了一个屹立90年的问题。它在一天内消耗了比大多数研究小组一年产出更多的token。确实耗费了数百万美元,但另一次尝试的边际成本接近于零。
下一个系统会更快、更便宜,也更擅长形式化验证。下一个证明将在数小时内到来,而非数天。数学发现的入门门槛——历史上这是一个缓慢、渐进、深深人性化的过程——正在崩塌。这不是科幻。它是正在发生的现实,伴随着真金白银和真实声誉的博弈。
问题是,数学能否在不失去其可信之源的情况下吸收这股冲击。一个证明不仅仅是一个结论。它是任何合格人类都能追溯的推理链条。如果这条链条过长、过于异质或过于晦涩,它就不再是欧几里得时代以来该领域所理解意义上的证明。
那个100万美元的问题
克莱研究所尚未承认这一提交。它没有邀请评审。它没有发表任何声明。这种沉默本身已说明问题。该研究所花费数十年建立了一套判定何为正确答案的标准。它不会因为一家公司能负担快速生成文本的费用就放弃这套标准。
OpenAI表示它不会声称这笔奖金。这引出了另一个问题:为何要公布一个你无意捍卫的答案?答案可能是战略性的。公告先于他人确立了一个事实——或至少是一种叙事。它改变了时间表。它让下一步看起来势在必行。
山姆·奥特曼关于泡沫的笑话可能意在转移视线。但更深层的讽刺在于,泡沫的存在恰恰因为这种能力是真实的,即使证明并非如此。模型能够完成以前无法完成的事情。它们能够——尽管肤浅地——推理那些曾令人类束手数代的问题。成本高昂。风险真实存在。而世界尚未准备好迎接接下来的事。
下一个难题不会是纳维-斯托克斯。它将更难、更具分量、没有任何单一数学家能独自解决。问题将不再是AI能否尝试解决它。问题将是:我们能否信任那个答案。