science 11 分钟阅读

OpenAI的AI破解数百道未解数学题,原因何在

OpenAI未命名推理模型在数百道著名未解数学问题上取得进展,从1930年代猜想至量子物理。这不仅是公关噱头,更是前沿AI真实走向的信号。

  • KakaoAI
  • Noam Shazeer
  • AGI
  • 伽罗瓦逆问题
  • Lean

值得关注的数字不是一个——而是数百个

OpenAI 在10月6日宣布,其内部推理模型(目前尚未命名)在数百个长期著名的数学难题上取得了重大进展。这些问题跨越了数十年的研究积累,涉及该领域一些最杰出的大脑。其中包括:20世纪30年代的马勒猜想、圆周率的无理指数、计算复杂度理论中的"唯一游戏"问题,以及位于数学与物理交叉领域的量子自旋系统相关问题。

这不是一个只会背诵已有证明的模型。这是一个产生了新数学洞察力的模型——而且结果已经在用手工和形式化验证工具进行核对。

这次尝试的规模很难用一个标题概括。我们谈论的不是几道竞赛风格的题目或披上挑战外衣的教科书练习。我们谈论的是那些在黑板和预印本上沉寂了近一个世纪的猜想,它们抵制了人类研究者提出的每一种方法。以马勒猜想为例,它涉及高维空间中凸体的体积问题——这类抽象几何对象与优化理论、概率论和泛函分析有着深刻的联系。它们一直是那些在这些学科交叉领域工作的研究人员心头的一根刺。一个AI系统能够同时在多个方面识别出新进展的区域,这不是一个小小的更新。这是地形的改变。

形式化验证到底有多"形式化"

OpenAI在发布任何内容之前,咨询了普林斯顿高等研究院(IAS)的数学与人工智能顾问组。结果发布于GitHub,而非同行评审期刊——OpenAI对此直言不讳。公司表示将根据社区反馈修订这些工作,并最终寻求更为传统的出版渠道。目前,这些证明正在使用Lean进行验证——这是一种专门为形式化验证数学论证而设计的编程语言。这很重要,因为这些声明并非悬挂在未经检查的博客文章中,而是存在于理论上可以检验其正确性的代码里。

这个过程并不简单。Lean已经成功用于验证代数的几何学的大量内容以及开普勒猜想——这是一个让托马斯·黑尔斯耗时十多年解决的难题,并且仍需数年的形式化验证才能确认。这不是一条通往可信度的捷径——它是一个守门人。如果OpenAI的结果能通过那里的检验,那它就通过了;如果不能,任何会读代码的人都能发现其中的错误。

这种方法之所以引人注目,是因为它绕过了可能需要数年的传统学术守门流程,代之以更快速、更透明的方式。这是一把双刃剑。一方面,它加速了对声明进行验证或反驳的速度;另一方面,它对数学界施加了巨大压力,要求其参与可能不完整或包含细微缺陷的材料研究。IAS顾问组的组建正是为了帮助应对这种张力,但没有委员会能完全替代成千上万的研究人员在长时间内独立审查结果所带来的分散式审视。

到底解决了什么,以及没有解决什么

OpenAI在某一点上格外谨慎:它并没有解决黎曼假设。克雷数学研究所的一百万美元奖金仍然悬而未决。模型所做的是找到了黎曼zeta函数没有零点的一个新区域。这是对通向假设之路的进展。它不是终点。

但这一区别很重要。马勒猜想、圆周率的无理指数,以及对稀释自旋玻璃和量子海森堡顺磁体的研究,与单个著名开放问题所代表的不是一回事。它们代表了数学和理论物理学多个子领域的持续、分散的努力。模型没有找到什么窍门,它似乎找到了新的领地。

以"唯一游戏"问题为例,它位于计算复杂度理论的核心地带,并对我们理解近似算法的极限具有影响。这里的进展不仅帮助数学家——它还 informs(影响)那些构建依赖困难性假设的系统的计算机科学家、密码学家和工程师。量子自旋玻璃的研究触及了物理学家几十年来的核心问题,任何进展都可能反哺材料科学或量子计算研究。这些不是孤立的奇闻。它们是 Human knowledge 网络中的节点,移动其中任何一个节点都可能改变整个结构。

这对AGI讨论意味着什么

AI领域的每一个人都在谈论前沿模型是否正在接近某种类似于人类推理的水平。这一公告迫使这一问题变得更加尖锐。模式匹配可以解答奥林匹克竞赛题,但它无法为黎曼zeta函数生成一个新的无零点区域。它也无法以这些结果所暗示的水平来推理量子自旋玻璃的结构。

马勒猜想已抵制人类数学家长近一个世纪。一个在此取得真实进展的模型,与一个能写代码或总结文章的模式相比,运行在不同的层次上。它做的事更接近于研究数学家所做的事:探测结构、检验猜想、在高维概念空间中寻找路径。关键词是"路径"。数学发现很少是一条直线。它包含死胡同、错误的开始,以及对局部洞察的缓慢积累——只有多年后才汇聚成完整的证明。能够导航此类图景的AI系统不仅仅是在存储知识——它是在探索知识。

这是否是AGI取决于你的定义。但它不可否认地是一种能力,直到最近仍被认为是推测性的。其影响远超出"机器是否能思考"这一哲学问题。如果AI系统能够以这种规模辅助数学研究,瓶颈就会从产生思想转向评估和整合思想。这是一个性质上不同的挑战,而该领域才刚刚开始面对它。

竞争格局正在转变

OpenAI的公告出现在竞争格局本就紧张的时机。中国的DeepSeek等模型最近颠覆了定价和能力假设。日本政府正在大力投资本土AI基础设施。美国则在应对出口管制和研究治理问题。这一数学结果是更大图景中的一个数据点,但它是一个响亮的信号。

如果OpenAI的模型能够系统地解决纯数学和理论物理中数百个开放问题,其含义不仅在于模型很聪明。它的含义在于,数学研究的瓶颈可能不再仅仅是人类创造力。它可能是大规模导航和验证产出的能力。这改变了发现的经济学。它也改变了地缘政治。控制前沿模型及其背后计算基础设施的国家,将在塑造数学和科学进步的方向上发挥不成比例的重要作用。

还有更深远的二阶效应。数学发现滋养密码学、材料科学、优化理论,并最终影响硬件设计。这些领域的进展反过来加速AI本身的发展。反馈循环是真实存在的,并且在收紧。每一个关于凸几何的新定理、每一个对量子自旋系统理解的进步、每一个复杂度边界的精炼,都有可能以难以预测的方式向外扩散——但不可能忽视。我们正在见证的不只是一个模型解决几个谜题。我们正目睹一种新的科学生产方式的早期阶段。

接下来会发生什么

GitHub仓库已经开放。数学家们正在审查。有些结果将成立,有些则不会。Lean验证将发现错误或确认它们。IAS的顾问组将发表意见。OpenAI已承诺改进呈现方式并提交正式出版。

这些步骤的时间表尚不明确。但底层信号已经清晰可见:前沿AI模型正在从模式补全走向需要真正抽象和长时间多步推理的领域。这是否会转化为OpenAI的实际优势,还是会成为数学社区的共享资源,取决于尚未做出的选择。OpenAI没有将结果锁在付费墙后面,而是邀请审查。这并非毫无意义。但这也不是确保更广泛社区能平等受益于后续发展的保证。

清晰的是,什么才算作AI推理的标准已经提高。这一周的提升幅度超过了此前所有年份的总和。问题不再是机器能否参与数学研究。问题是什么时候、在多大程度上、谁会受益、谁有权决定。