OpenAI的722篇数学论文,证明不了它声称的事
OpenAI在GitHub发布了722篇AI生成的数学论文,声称在黎曼猜想相关问题上取得突破。但其中不少缺乏形式化证明,曾经反对这种做法的顾问团对此缄默,整体仍呈现出过度宣称的惯性。
宣称超越证据
OpenAI 在 10 月 6 日宣布,其内部前沿模型产出了 722 篇数学手稿,其中许多附有 Lean 形式化证明,并已上传至 GitHub。媒体焦点集中在黎曼猜想上。但事实更为复杂,在许多方面也更值得玩味。
该模型并未证明黎曼猜想。它产出的是与相关问题有关的结果——具体而言,是黎曼ζ函数零点不可能存在的区域。其中一篇相关主题的论文经过人工编辑以提升可读性。其余手稿均通过一条连贯的管道在未公开发布的模型上生成,平均每篇手稿消耗的算力约相当于三次 ChatGPT Pro 推理时长。
这很重要。这不是一次单一突破,而是一项规模化的产出工程。
筛选本身才是关键
OpenAI 最初从约 4,000 道题目入手,经筛选后保留了 722 道,依据是结果的重要性。这意味着近 80% 的产出被舍弃。公司未公布完整结果集,也未详细说明剔除标准,更没有披露其未能解答的题目数量。
这对任何持怀疑态度的读者而言是第一个警示信号。在正常的数学实践中,否定性结果和失败路径与成功同样有价值。而在 OpenAI 的发布中,它们毫无踪影。这 722 篇代表的是筛选后的结果,而非完整覆盖。
选择性本身并非不诚实——每本学术期刊都实行这种筛选——但这种不对称依然引人注目。一个研究团队在公布 722 项经核实的结果的同时,完全不提及任何失败尝试,呈现出的能力图景必然扭曲。不熟悉数学界的读者会接受一种“持续成功”的叙事。这种叙事具有营销价值,但也伴随着认知代价。
次级后果已经显现。推特上的串联帖和博客文章已将此次发布当作证据,宣称人工智能已“解决”或“攻克”黎曼猜想。公司谨慎的表述与公众解读之间的鸿沟,正以 OpenAI 内部人员来不及纠正的速度扩大。等澄清流传开来, headline 早已完成它的使命。
Lean 并非保证
许多论文附有经 Lean 检查的形式化证明。这确实 noteworthy。Lean 证明验证是少数几种能将人类模糊性从数学论证中剔除的方法之一。一份经 Lean 验证的证明,几乎等同于正确性的证书。
但并非所有结果都已形式化。OpenAI 公开承认这一点,并表示未形式化的工作中可能存在漏洞。公司承诺加以修正。从表面看,这是负责任的做法;但这同时也是一种延期的审计。任何希望核实输出内容的人,现在必须逐一审阅 722 篇手稿,甄别哪些缺少 Lean 覆盖,再手动核查。负担已从发布者转移到整个社区。
这是一个结构性问题,而非道德问题。OpenAI 无法以其当前规模对所有生成内容进行形式化验证;但它也不能对其发布的一切宣称 proof。两种阵营之间的模糊地带,正是争议所在。
这里还存在更深层的张力。Lean 形式化要求将非形式化的数学推理翻译为机器可读的格式。这一翻译过程本身就可能引入错误——遗漏引理、误置假设,或让微妙的逻辑漏洞滑过自动检查。证明存在于 Lean 中是强力的正确性证据,但并非无懈可击。学界已见过示例:某些经形式化验证的证明在边界案例浮现后仍需修订。
曾说不的顾问委员会
OpenAI 在发布前征询了数学与人工智能顾问组(AGMAI)的意见。该组于九月份发布的建议颇具参考价值。其中呼吁设立独立存储库、完整披露模型与提示词、时间与成本透明、在可行时进行形式化验证,并在已解决问题旁同时公布未解决问题数量。
随后,AGMAI 在发布当天发表了一份澄清声明。它表示,其建议并不背书 OpenAI 的结果;该组并不代表数学界;评价工作应属数学家,而非顾问。
潜台词很清楚:AGMAI 推荐了 OpenAI 仅部分达成的标准,而该组已开始与成果划清界限。这种顾问关系看起来更像一道责任边界,而非认可印章。
这一事件揭示的是 AI 实验室与可能对其进行问责的机构之间日益加剧的摩擦。像 AGMAI 这样的顾问团体处于尴尬的中间位置——它们提供可信度却不拥有权威。其建议可在方便时被忽略,也可在有用时被引用。无论哪种结果都不利于巩固其地位。本就对科技公司挪用自身话语持怀疑态度的数学界,正在密切观察。如果 OpenAI 将 AGMAI 的指引视为可选项而非基础性框架,其他实验室会将此解读为同等行径的许可。
模式即问题
这并非 OpenAI 首次越界失足。九月份,该公司声称其内部模型已解决纳维 - 斯托克斯存在性与光滑性问题,这是一道千禧年大奖难题。该领域数学家强烈反驳,此宣称未能经受住 scrutiny。
八月,OpenAI 报告了其下一代旗舰模型 Astra 内部版本在十个开放问题上的结果。2025 年十月,一位高管关于用 GPT-5 解决埃尔德什问题的帖子在批评声中被迫删除。
模式一脉相承。OpenAI 产出雄心勃勃的结果,向公众宣布,随后遭遇专家对其推理或表述漏洞的反击。每次事件都在侵蚀信任,每个循环都在将“AI 能解决难题”的观念常态化,即便证据薄弱。
累积效应比任何单一事件都更重要。当 AI 公司反复就数学进展发布半真半假的消息,更广泛的公众便逐渐丧失辨别真正突破与表演性成果的能力。这会形成信誉陷阱:即便 OpenAI 后来做出真正重要的成果,那些被耸动 headline 训练过的受众也会习惯性怀疑。公司正在为增量式宣布而透支其声誉资本。
谁获益,谁受损
OpenAI 赢得关注。GitHub 仓库可供检索,722 篇论文均已索引。研究人员可以从中挖掘思路、引理或计算方法。这是真实价值。数学研究向来会从相邻领域汲取养分。一台能产出大量经形式化检查成果的 AI,或许能加速这一进程。
数学家失去的则更微妙。他们对“何种结果算作证明”的权威正被稀释。当前沿模型产出的结果能部分通过验证工具,机器辅助与机器 authored 之间的界限便趋于模糊。同行评审无法跟上产出规模。系统终将适应,但过程会混乱且缓慢。
更广泛的公众失去清晰性。headline 会说 OpenAI 证明了黎曼猜想的某个方面;但它们不会注明公司并未证明此类内容。每条新发布都会拉大 headline 与文档之间的差距。
还有一位较少被讨论的受损者:数学界的集体耐心。每当一家公司歪曲其成果,数学家就必须花费时间纠正记录,而非专注于自身研究。这种时间不可再生。在反复循环中,它成为一种真实的资源消耗——而资源本就捉襟见肘的早期职业研究者受影响尤重。
接下来会发生什么
OpenAI 计划举办研讨会和专项项目,帮助数学家理解 AI 生成的结果;称正在推动模型的负责任正式发布;并考虑在 GitHub 之外建立由社区运营的发表平台。这些都是合理步骤,却并不能抹去此次发布存在的问题。
最重要的问题并非 AI 能否帮助做数学——它能。问题在于,构建这些系统的公司是否会采纳一套标准,让社区能够规模化地核实、复现并反驳其宣称。OpenAI 的最新产出是一个里程碑,也是一记警示。模型能够产出;问责基础设施仍在追赶之中。在该基础设施成熟之前,数学界应以对待任何预印本的谨慎乐观来审视这类发布——感激其中的有效信号,不为炒作所动,并在两者混淆时守住底线。