technology 8 分钟阅读

AI 宣称获得菲尔兹奖级数学突破

OpenAI 发布 722 篇 AI 生成数学论文,其中一篇准黎曼猜想声明被一位菲尔兹奖得主称为'立刻获奖水准'。但数学界质疑:谁来验证验证者?

  • KakaoAI
  • Noam Shazeer
  • Lean
  • AI数学

那份震动整个学科的论文

十月初的一个清晨,OpenAI 发布了 722 篇数学手稿。不是 arXiv 预印本,也不是会议投稿,而是来自内部系统的一次批量发布——这些手稿从未经过同行评审,从未在答辩委员会面前接受过质询,更从未——直到那一刻——被置于人类数学审视那套缓慢而审慎的机制之下接受检验。

这一合集横跨数论、代数几何与数理逻辑三大领域,分为 372 个结果集群,代表了该公司所称的一款 AI 模型在突破现有基准边界、进入真正未解研究领域的产出。如果这一说法即便部分成立,其含义也是令人震撼的:机器不再只是解答教科书习题,它们正在产生猜想和部分证明,而这些领域的人类数学家已经停滞数十年。

“准黎曼"命题

最受关注的那篇论文涉及 OpenAI 所称的"准黎曼假设”——这是对七个千禧年大奖难题之一的推进,其中最著名的那道题悬赏 100 万美元,自 1859 年伯恩哈德·黎曼提出以来至今未被攻克。

该命题并未直接证明黎曼猜想。它声称的是:黎曼 zeta 函数和狄利克雷 L 函数的非平凡零点位于复平面上一个比先前已知范围更靠右的区域——具体而言,实部可达 7/8,相比之前的界限是一次显著提升。

若此结果正确,这将是数十年来该猜想方面最重大的进展之一。若不正确,它将成为一则关于未经核实的人工智能数学成果之风险的警示寓言。

新泽西州罗格斯大学的数学家 Alex Kontorovich 称这一结果为"若是人类所完成,堪称菲尔兹奖水平"——但他描述的或许是其雄心,而非已获证实的成就。这一区分至关重要——而整个数学界如今正置身于这一区分之中。

验证鸿沟

核心张力在于此:OpenAI 为 722 篇手稿中的许多篇附上了形式化验证材料,以 Lean 语言写成——这是一种专门为以机器精度检查数学证明而设计的编程语言。但并非所有结果都通过了形式化验证。公司明确承认了这一点,并指出未经核实的手稿可能包含错误。

计算数学中这并不是新问题。计算机辅助证明长期以来一直面临同样的可信度鸿沟:机器检查了逻辑,但谁来检查机器的假设、编码和执行?如今的差别在于规模——372 个结果集群,其中一些需要数小时进行序列推理,由一个个体研究者无法全面审计的系统生成。

传统的数学验证流程——猜想、证明框架、同行评审、修订、发表——其时间尺度以月和年计。OpenAI 将其压缩成了一次算法性爆发。这些结果尚未成为既定的数学知识,而是一批等待人类去验证的原始语料。

谁来验证验证者?

数学界的反应层次分明,有时甚至相互矛盾。围绕普林斯顿高等研究院组织的二十位菲尔兹奖得主组成了一个顾问小组,呼吁人工智能生成的数学成果接受与传统研究相同的公开评审、修订和引用流程。OpenAI 表示将考虑这些建议,并在 GitHub 上发布了这些手稿及其编辑历史。

但该小组更尖锐的诉求——要求企业停止使用专有且未发布的模型来检验未解决的高阶数学问题——遭到拒绝。OpenAI 认为,加速开发支持数学和科学进步的工具,需要继续对内部前沿模型进行评估。

从商业角度看,这一拒绝并不出人意料。但从学科角度看,它令人警醒。数学一直秉持透明性原则:每一个命题都必须能够追溯至公开的、可验证的推理过程。一个从黑箱模型中生成结果的 AI 系统,创造了一种新的知识主张类别——它可能是正确的,可能是不易察觉的错误,而学界尚无处理此类情况的既定规程。

数字背后的焦虑

整个事件中或许最具启示性的细节出自《华尔街日报》的一则报道:当消息传出 OpenAI 可能发布大量证明时,一些数学家争先恐后地抢先发表自己借助 AI 完成的研究成果。他们担心的并非 AI 错了,而是 AI 对了——但它得出的结果会早于构建相应基础设施的人类研究者抢得优先权。

这种被超越的焦虑并非数学界独有。每当机器推理的速度快于制度流程所能承载之时,类似的焦虑便会回荡于各个领域。但在数学中,这种焦虑的感受尤为特殊,因为整个学科的合法性建立在一个单一而脆弱的假设之上:每一个命题都能被任何具备能力的独立人类心智加以检验、复现和质疑。

如果这一假设被侵蚀——哪怕只是轻微地——这个领域的基础就会发生位移。结果不仅仅是一种新工具,而是一种新的认识论。

这对机器推理意味着什么

OpenAI 此次发布真正的意义或许与其具体定理无关,而在于它揭示了机器推理的当前状态。一款模型产出 722 篇手稿,其中一些触及困扰人类研究者逾一个世纪的问题,这表明在数学层面的深度序列推理已不再是科幻小说。这是一项工程挑战——而公司将其视为内部基准,而非公开发布的交付成果。

“准黎曼"推进本身——无论最终是否通过验证或需要修正——确实是一个真实的进展。扩展黎曼 zeta 函数的无零点区域需要艰苦的工作;用算法方式做到这一点更难;而在全然缺乏透明方法的情况下做到这一点则令人不安。

接下来发生什么将决定这一刻究竟是计算数学的一个里程碑,还是一个仓促发表的警示案例。手稿已经公开,验证却尚未完成。数学界如今背负着一种不寻常的重担——追赶一台早已继续前行的机器。