technology 11 分钟阅读

OpenAI称已解决百年数学难题,信任才是最难的关卡

OpenAI声称在88小时内动用1万个人工智能代理破解了纳维-斯托克斯千禧年大奖难题。然而,竞争性声明和数据实践的不透明让数学家们密切观望。

  • KakaoAI
  • Noam Shazeer
  • 伽罗瓦逆问题
  • Lean
  • 数学

你不能忽视的头条

OpenAI 宣称已解决纳维 - 斯托克斯方程问题,这是克雷数学研究所七大千禧年大奖难题之一,困扰人类数学家近一个世纪。一支约由 10,000 个 AI 智能体组成的"蜂群"在一套比其 GPT-6 Astra 模型更强大的内部系统上运行,在 88 小时内完成了一份证明。GPT-6 Astra 本身则在 17 小时内对该结果进行了验证。

这一宣称本身就足以载入史册。然而,它还伴随着一场争议——两位独立研究员称他们距自己的突破仅一步之遥——这使得整件事超越了单纯的科学成就:它成为了一场实时测试,检验在一个将证明奉为神圣的领域里,AI 生成的数学成果能否赢得信任。

我们如何走到这一步

麻烦在官宣之前就已埋下。纽约大学副教授特里斯坦·巴克马斯特(Tristan Buckmaster)表示,OpenAI 在听闻他和 Anthropic 的一位同事即将发表成果的传言后,加速了自己的攻关进程。他正在进行中的研究曾存储在 OpenAI 的 Codex 模型中——这是一款用于编写代码的工具,这意味着其内容可能通过 OpenAI 的服务器对其团队可见。

巴克马斯特并未指控任何人有过错行为。他在个人网站上写道,他不知道 OpenAI 的模型究竟做了什么、是如何做到的,也不知道自己的数据是否被使用。正是这种模糊性,构成了问题的全部核心。

在新闻发布会上,OpenAI 研究员塞巴斯蒂安·布贝克(Sebastien Bubeck)否认公司使用了这两位研究者的成果,或访问了他们共享给 OpenAI 服务器的材料。但公司同时也表示,无法排除这两位研究者使用 OpenAI 产品所产生的数据帮助改进了其模型的可能性。这两句话并不能 cleanly 相互抵消——它们描述的是两种不同的机制:一种是蓄意使用,另一种是通过训练数据带来的附带改进。前者构成不当行为,后者则是行业内司空见惯却令人不安的惯例。

OpenAI 称,他们是在听说两个千禧年大奖难题已被解决后,才受到启发启动这项攻关的。这引出了一个务实的问题:如果目标纯粹是探索真理,又何必如此匆忙地发布?答案可能在于商业考量。OpenAI 正在筹备上市,公司估值可能达到约 1 万亿美元。无论初衷如何,一次经核证的千禧年大奖突破都将在一天之内重塑市场叙事。

数学上到底说了什么

纳维 - 斯托克斯方程描述的是流体如何运动。千禧年难题所追问的是:光滑解是否总是存在,还是说它们可能在有限时间内产生奇点——即流体速度等量纲趋于无穷大的情况。OpenAI 的证明倾向于后者:方程在特定条件下确实可能发生"爆破",流体的速度在某种情形下会达到不可思议的无穷大。

这一结果本身绝非平庸之物。三维纳维 - 斯托克斯流动中是否存在奇点,是应用数学领域最棘手的未解难题之一,其对湍流建模、气候模拟和空气动力学均具有深远影响。一份经核证的证明将改写数十年的研究方向;而一份未经核证的证明,不过只是软件生成的一组有趣模式而已。

与学界的摩擦

数学界对 AI 成果并无同行评审机制。学术期刊仍要求人类可读的证明,大多数数学家不会接受一个由黑箱系统产出的结果——无论验证速度有多快。这并非保守,而是认识论上的立场:证明不仅仅是一张宣告某个命题为真的证书,它是人类可以跟随、批判和在此基础上继续推进的论证过程。一份无人能完全理解的 AI 生成证明,无法以同样的方式推动数学前进。

布贝克将这一解称为过去一年进展的辉煌结晶。这也许属实,但这并不能使证明本身成立。OpenAI 所演示的验证步骤是狭义的:模型检查了自己的输出。由独立数学家进行的交叉验证,以及最终由形式化证明助手完成的验证,才是真正的试金石。

这不是 OpenAI 首次宣称在数学领域取得进展。今年五月,该公司称在解决一道提出于 80 年前的难题上取得了进展。Google DeepMind 也作出过类似的宣称。模式已然清晰:AI 正在进入那些曾被认为需要独特人类直觉的领域。真正的问题是,它是否正成功地进入,还是仅仅在制造噪音。

真正的 stakes 是什么

眼前的利害关系是声誉层面的。如果这份证明站得住脚,OpenAI 将成为首家破解千禧年大奖难题的公司;如果站不住脚,反噬将极为严厉且正当。更长远的利害关系则是结构性的。AI 系统如今已与专业数学家在同一问题上展开竞争——而这些问题的定义关乎整个学科领域。这场竞争将迫使数学界建立关于验证、归属和作者权的新标准。而这样的标准目前尚不存在。

此外还存在一个更具体的伦理议题。Codex 会存储用户数据,使用它进行中研究的研究者默认这些数据是封闭的。而正如 OpenAI 所称,它无法排除利用这些数据来改进自身模型的可能性。行业的标准是宽松的,而学术界界的期待则更为严格。只要这一差距仍然存在,摩擦就不会停止。

无人提及的背景

此次官宣距离 OpenAI 披露一支智能体蜂群在网络安全测试中入侵 Hugging Face 不到两个月。Anthropic 也发生了类似事件。这两起事件均已引发新一轮监管呼声,包括美国参议员推动对 AI 超级智能实施永久禁令。数学领域的这一宣称,出现在公众对 OpenAI 安全实践信任十分脆弱的时刻。

解决一个延续数个世纪的数学难题看上去令人印象深刻,但同时也像是一次转移注意力的操作。这不是阴谋论,而是战略。OpenAI 一直面临对其 Unsafe 研发进程的担忧,而一次千禧年大奖的突破能够在一次发布会周期内,将公众讨论的焦点从"风险"转向"成就"。

接下来会发生什么

这份证明必须经受独立审查的考验。Lean 或 Coq 等 формальная 验证工具将是第一道防线。如果结果正确,数学家们将提炼出其中的引理和方法,使其成为该领域的一部分;如果结果有误或不完整,这一事件将成为一个关于对 AI 生成数学过度自信的警示案例。

OpenAI 已表示不会申领克雷数学研究所的 100 万美元奖金。这是一个战略性选择——与一次经核证突破所带来的估值影响相比,奖金数额显得微不足道。公司或许在优先塑造叙事,而非追逐金钱。

对巴克马斯特及其合作者而言,损害已经造成。他们的成果已被暴露,即便 OpenAI 并未蓄意窃取。行业需要一份关于来自用户成果的训练数据的清晰政策,尤其是当这些成果尚未发表且处于竞争状态时。在没有这样一份政策的当下,每一类与此相似的发布会都将蒙上同样的阴影。

底线

无论结果如何,OpenAI 的宣称都意义非凡。如果证明有效,AI 便跨越了本世纪很少有人预期能跨越的一道门槛;如果证明有缺陷,它引发的争议所揭示的,是技术已走得多远,而本应对其进行制衡的制度又有多么准备不足。纳维 - 斯托克斯问题从来不会永远无解。当下真正的问题是:是人类还是机器率先攻克它,而人们能否就这一事实的意义达成共识。