business 8 分钟阅读

OpenAI数学声明暴露AI可信度差距

OpenAI发布了数百份数学证明,却未达到其所宣称的标准,AI营销与可验证成果之间的差距日益扩大,数学家们对此发出批评。

  • KakaoAI
  • Noam Shazeer
  • iPhone 18 Pro
  • 科技政策
  • Lean

顾问组的准则清清楚楚,OpenAI 却基本置之不理

本周,OpenAI 发布了一批声称破解了全球最棘手数学问题的方案。实验室方面称,此次发布前曾征询过由顶尖数学家组成的顾问团队意见,原本是为了避免重蹈上次重大解题成果发布时争议的覆辙。但事与愿违。

OpenAI 未能达到它自己所标榜的标准,尤其是在数学家们反复强调的“人类理解”这一不可妥协的要素上。这种言行之间的落差,正逐渐演变为 AI 公信力危机的核心注脚。

由普林斯顿高等研究院承办的“数学与人工智能顾问组”(AGMAI)于九月底向前沿实验室发布了相关指南。该顾问组由九位来自全球知名的研究人员组成。他们的第一条建议直言不讳:停止在专有模型上测试高级数学问题。而 OpenAI 的发布声明恰恰明确写着“我们正在做这件事”。

实验室遵循了部分原则——快速公布成果、附带模型如何得出结论的信息。但只是选择性遵循。在 719 篇论文中,仅有 10 篇包含了模型的思维链。对于那些人类尚未完全理解的论文,AGMAI 建议通过 Lean 等工具进行形式化验证;Lean 是一种编程语言,能通过将证明编译为代码来验证其正确性。然而 OpenAI 的证明中,只有 42% 经历了这一流程。

更重要的是,顾问组要求 OpenAI 协助资助那些将使这些解法产生实际价值的人类数学家。但实验室方面并未显露任何承诺的迹象。当 AGMAI 要求提供机器可读的元数据,用于将自然语言证明与形式化产物对应起来——本质上就是一张让人类能跟进理解翻译过程的“地图”——OpenAI 同样没有提供。

一场不该被忽视的“误译”

本周,剑桥大学与伦敦国王学院的数学家们发表了一篇论文,记录下了跳过人工复核所带来的具体风险。研究人员发现,在针对纳维-斯托克斯方程(Navier-Stokes equations)衍生出的那个附带百万美元千禧年大奖的著名流体力学问题中,OpenAI 所提证明的自然语言解释与其背后的 Lean 代码之间,至少存在两处差异。

这些差异未必能推翻整个解法。但它们充分证明,前沿实验室不能简单地将“人类可读的数学”自动翻译为“机器可验证的代码”然后就此了事。这个过程极其脆弱。论文作者写道,这些自动形式化的 Lean 证明“绝不能仅凭表面就予以信任,而必须接受与其他证明相同的同行评审流程与严格审视”。

这门槛低得可怜。任何正式发表的数学成果,在成为学术正典之前都必须经历同行评审。而 OpenAI 的发布完全绕过了这一步。

理解之困

斯坦福大学数学家、菲尔兹奖得主陶哲轩一直是 OpenAI 做法的公开批评者,他在成果发布后于社交媒体上直陈观点:这些问题正被“AI 提示工程师”自主求解,而这些人在达成初始目标后便对更广阔的数学领域失去兴趣,且对 AI 产出的结果理解不透,根本无力回答问题、发表演讲或与其他从业者进行任何实质交流。

最后这一点正是核心症结所在。当人类数学家发现一个成果时,他们会为此承担责任。他们会发表它,在研讨会上展示它,应对同事们的质询。学界会审视它、推演它、应用它,理解随之加深。成果由此融入共享的知识体系,而非沦为黑箱输出。

“当一个模型被提示去解一道难题,随即吐出一份解法,在发布的那一刻,并没有人类真正理解它。而此刻,真正的工作才刚刚开始。”哈佛大学数学教授梅拉妮·伍德(Melanie Wood)表示。换言之,模型发布并非过程的终点,而是起点。而如今,却没有人愿意接过这颗球。

为何此事的意义远超数学

OpenAI 的这场数学风波,远不止于几份证明是否经得起推敲。它是一个典型案例,揭示了当整个行业为了抢占叙事高点而加速越过验证环节时,会发生什么。这家实验室本想塑造负责任的形象——咨询顾问组、快速发布、提供透明度。但内容终究配不上包装。

这种模式正在 AI 基准测试中不断重演。模型声称在评估中取得高分,但这些评估衡量的只是接近推理的某一方面,而非完整的推理能力。成果在同行评审之前便已发表。各种争议性说法四处流传,只因为它们足够吸睛,而非因为它们经受了严格检验。

剑桥与国王学院的数学家们说得很明白:如果你希望 AI 生成的证明被认可为该领域的真实贡献,它们就必须经受住与真实贡献相同的流程检验。不是新闻稿,不是顾问组的合影摆拍,而是真正的人类深度介入。

AGMAI 并未回应 TechCrunch 关于对 OpenAI 最新发布进行更彻底评估的请求。这种沉默或许意味深长。顾问组的准则十分明确,OpenAI 的成果也已公之于众。两者之间的落差,如今已是既定事实。

接下来会发生什么,取决于数学界是将这些发布视为合作的起点,还是仅仅当作趣闻归档。前者惠及所有人;后者则会让 AI 生成的数学恰恰沦为陶哲轩所警告的那样:无人认领的输出、缺乏理解的答案,以及无需负责的宣称。