OpenAI数学发布冲击基准信号
OpenAI发布377个AI生成的数学证明,试图回应数学家对Navier-Stokes问题的担忧。但这引出更深的问题:大量未解结果的泛滥,是在加速理解还是在摧毁追踪真实进步的基准?
基准测试悖论
OpenAI 在周二晚上做了一件不同寻常的事。它没有将最新的数学成果锁在内部专有研究中,而是公布了 377 份解决方案,涵盖了代数、数论、理论计算机科学、数学逻辑和拓扑学。其中十份解决方案包含了模型得出每个答案的思维过程摘要,生成每份结果约耗时三个小时。
此举发生在两周前该公司声称解决了纳维-斯托克斯方程——七大千禧年大奖难题之一,每题奖金 100 万美元——之后,数学家们随即发出强烈质疑,质疑该结果是否体现了真正的推理能力,还是仅仅在别人已完成的工作上附加了最后一步。
OpenAI 将此次发布定位为对前述争议的回应。它援引了普林斯顿高等研究院主办的独立咨询委员会的建议。该委员会是在纳维-斯托克斯争议后成立的,建议 AI 实验室同时发布提示词与完整的思维链。OpenAI 在公告中引用了此项指导。
然而,这次发布也暴露了整个领域的一条裂痕:OpenAI 并不认同委员会关于公司应停止让专有模型接受高阶数学问题测试的建议。OpenAI 研究负责人 Dan Roberts 称,测试对于构建更优工具至关重要。他表示,证明成果只是副产品。
基准失效,谁之损失
此次发布最非显而易见的后果并非 AI 现在能解出难题。而是公开发布这些结果的行为,摧毁了该领域用来衡量 AI 是否进步的信号本身。
多年来,基准测试的运作逻辑曾是这样的:研究者提出难题,公司用模型进行测试,若模型未能解答,基准便作为衡量进步距离的标尺继续存在;若解答成功,便宣告突破,接着挑战更难的题目。
OpenAI 现已实质上解决了数十个原本被用作下一阶段基准的难题——这类题目通常由博士生或博士后面对,以测试系统是否能踏入真正的数学研究领域。在早期的奥林匹克风格难题被证明过于简单后,OpenAI 才构建了这些基准。如今这些也不再构成挑战。
取而代之的将是什么?目前尚无人知晓。OpenAI 内部仍有模型在未公开的题目上继续测试。而领域其余部分只能在一个坐标已被公开揭示的移动靶标前,尝试校准进步。
纽约大学数学家 Tristan Buckmaster 正从事纳维-斯托克斯问题研究,他指出当前发布未尽到充分的审慎义务。他还提出一个更令人不安的可能性:数学家通过论文、预印本或甚至在线讨论向 AI 系统输入思路时,可能无意间提供了原始材料,让 OpenAI 在发起者人类完成之前便完成了证明。
很可能存在大量此类成果:它们取用某人的工作并将其完成,Buckmaster 说。
速度 versus 理解之争
更深层的张力并非技术问题,而是认知论问题。数学的进步依赖于证明被理解、内化并在此基础上建构——而非仅仅被验证后归档。
这 377 份证明中,许多经 Lean 这一形式化语言验证了逻辑正确性。Lean 验证确认论证有效,但并不能保证人类数学家能够阅读该结果并从中提炼出洞见。
多伦多大学数学研究生 Kai Shaikh 如此总结:问题归结为两种相互竞争的人类冲动——竞争与对美的欣赏。在他看来,这似乎是前者试图扼杀后者的案例。
哈佛数学家、咨询委员会成员 Melanie Wood 则称,此次发布是起点,而非人类理解过程及将工作纳入数学知识的终点。
这种框架至关重要。它承认验证与发表并不等同于理解。这也表明,数学家们真正的艰辛工作才刚刚开始——而这并非 AI 的工作。
接下来会发生什么
短期内,大量数学家会试图重构每项成果的来源溯源——判定哪些开放性问题已接近人类研究者的解答临界点,以及 OpenAI 的模型是否仅仅抢先冲过终点线。这 377 份成果中,有些可能只是增量式完成的部分论证,另一些则可能代表真正全新的思路。整个领域要数月后才能厘清。
OpenAI 的内部测试仍在未发布的题目上进行中。这意味着公司的真实能力上限仍隐藏在未公开基准的屏障之后。咨询委员会关于停止在高等数学问题上测试的建议已被否决。竞赛并未放缓脚步。
正在减速的是外界衡量竞赛进展的能力。基准信号已被破坏。领域现在处于部分盲飞状态,试图理解那些以超越社区消化速度抵达的成果。
此次发布被包装为透明之举。但在实践中,它发挥的是校准冲击的作用——在证明能力之余,也让世界其余部分更难追踪后续发展。