science 9 分钟阅读

OpenAI 声称已解决 100 道数学难题,但谁能验证?

OpenAI 表示其最新模型破解了 100 道未解决的数学难题,其中包括一道千禧年大奖难题。数学家们随即反驳——随后 OpenAI 悄然组建了一个评审小组。从宣称成果到证明成果,其中的可信度差距正越拉越大。

  • Noam Shazeer
  • 人工智能
  • Ven Chandrasekaran
  • Navier-Stokes 方程
  • June Huh

声明跑在证据前面

OpenAI 称其内部模型于 8 月 28 日开始训练,已解决 100 多道长期悬而未决的数学难题。其中包括纳维-斯托克斯存在性与光滑性问题——七道千禧年大奖难题之一,每道奖金 100 万美元。公司 9 月 9 日宣布,仅用 88 小时就攻克了纳维-斯托克斯方程。这份超过 100 道题的完整清单尚未详细公开,但其重要性 arguably 超过任何单一成果。

数学家们没有等待论文面世。一封由 25 位该领域最著名学者签署的公开信——其中包括普林斯顿大学的 June Huh 以及菲尔兹奖得主陶哲轩——警告称,以 AI 竞赛方式求解数学问题可能对这门学科造成长期伤害。OpenAI 的回应并非逐条反驳,而是搭建了一个结构:在普林斯顿高等研究院设立一个由九位数学家组成的独立顾问小组,负责审核并协调 AI 生成成果的发布时间。

这一架构是一次精明的公关举措。然而,其背后的张力远比这更难化解。

这对数学意味着什么

当下的核心问题不在于 OpenAI 的声明是否属实——而在于是否有人能验证它们。数学证明不是一个答案,而是一条可由人类逐段检视的推理链。AI 可以产出一串编码为证明的符号。它也可以产出一串看起来像证明、实则错误的符号。这种差异有时连训练有素的数学家都无法实时辨别,更遑论机器。

June Huh 的名字出现在那封公开信上尤为分量十足。他因在组合学与代数几何之间建立联系的工作于 2022 年荣获菲尔兹奖——在这两个领域,直觉与人类洞察向来与发现密不可分。他的签名表明,担忧并非卢德主义式的盲目排斥。真正令人恐惧的是,一场由 AI 生成的成果洪流将以企业发布速度而非同行评审的节奏被验证,从而重塑数学的研究方式,而不仅仅是改变了研究对象。

顾问小组的授权范围正是对这一恐惧的回应。它审核 AI 生成的成果,并协助协调成果的公开时机与方式。但它无法影响 OpenAI 的研发节奏。该小组没有报酬。在每一个实操意义上,它是发表的刹车,而非生产的刹车。

这一区分至关重要。OpenAI 仍在以快于独立小组审核速度的节奏释放声明。这个小组是审查委员会,而非守门人。

验证瓶颈

全球 AI 行业应当认清这一点:OpenAI 的数学里程碑——如果属实——与其早前关于编程、科学和推理能力的声明处于同一拐点。每一次,模式都在重复:AI 以人类实验室无法企及的规模和速度产出结果。成果令人印象深刻,但验证鸿沟同样巨大。

千禧年大奖难题之所以被选中,正是因为人类尚未能解决它们——并非因为它们冷门,而是因为它们位于数学理解的前沿。解决其中任何一道,不仅需要计算,更需要概念上的创新。如果 OpenAI 的模型真的解决了一道题,其含义令人震撼;如果它产出了一段尚无法逐条检视的证明,其含义同样令人震撼,却危险得多。

顾问小组的存在承认了这一困境,却未能弥合这道鸿沟。九位数学家,独立工作、无偿服务,无法在下一轮企业发布之前验证 100 道成果。时间线在结构上就是不对称的:OpenAI 控制发布,小组控制审核,而审核永远滞后。

谁赢谁输

公司赢得了信誉。它们证明了自身的模型能够触及曾经被认为无法自动化的问题。投资者和客户看到了一个具体的里程碑,而非模糊的能力宣称。无论这些证明能否经受住检验,股市和舆论都因这一公告而受益。

数学界则失去了主动权。每一个新的 AI 生成成果都将话题推向公司设定的截止日期,而非该领域自主掌控的评审周期。那些原本可能用数年时间去攻克一道千禧年难题的年轻研究者,如今面对的是一个由企业宣称解题并以新闻稿形式发布的格局。

更广阔的 AI 生态获得了一个可复制的模板。这是 OpenAI 第二次面临完全相同的压力循环——声明、 backlash、顾问小组。同样的架构可以复制到生物学、化学,以及任何 AI 产出正快速超越人类验证能力的领域。这个顾问小组并非独特的解决方案,而是一种可复制的危机管控机制。

次生故事

真正值得关注的并非 AI 解出了一道高难数学题,而是 OpenAI 如此迅速地就需要一套危机管控机制。公司在任何证明经过独立检验之前,就已预判到了舆论反弹并搭好了顾问小组。这种前瞻性意味深长。它表明 OpenAI 比数学界自身更清楚合法性风险所在,而这种风险是结构性的,而非偶发的。

对于韩国以外的英语读者而言,June Huh 的身份是连接这座桥梁。一位韩裔美国人菲尔兹奖得主与陶哲轩联名签署公开信,将此事牢牢锚定在全球关于 AI 与数学诚信的讨论之中。它也凸显出一个在西方 AI 报道中经常被忽视的人群:美国与欧洲之外的数学家,他们受自动化证明生成趋势的影响最为直接。

接下来会怎样

有三点值得关注。第一,100 道声称的成果中,是否有任何一道能在一年内产出经独立验证的证明。第二,顾问小组是否真正获得对发布时机的否决权,还是仅停留于名义上的咨询角色。第三,其他 AI 实验室是否会效仿这一模板——声明、遭遇反弹、组建独立审查机构,循环往复。

如果这些证明经受住了检验,数学将进入一个辅助发现的新时代。如果它们没有,这一事件将成为"超越验证能力的代价"的典型案例。顾问小组并不决定结局。它只决定世界看到的是失败,还是成功。

OpenAI 的举措从一开始就以结果而非架构来评判。架构已经就位,结果尚未公开。接下来的 12 个月将决定这个行业站在鸿沟的哪一边。