business 11 分钟阅读

OpenAI数学发布冲击同行评审边界

OpenAI通过GitHub发布722篇解决数百个开放数学问题的论文,此举挑战了学术同行评审制度,并引发了关于AI时代科学验证的深刻疑问。

  • Noam Shazeer
  • 伽罗瓦逆问题
  • Lean
  • 显微镜
  • 计算证明

证明见于平台

本周,OpenAI将722份手稿上传至GitHub。这些文件涵盖372个结果家族,据该公司及独立咨询小组称,其中包含了对数学领域数百个长期开放问题的解答。此次发布附带了模型的推理摘要、计算资源估算,并声称平均每个结果的求解相当于ChatGPT Pro进行了三小时思考。

引人注目的并非论文数量,而是它们发布的位置。不是期刊,不是经过同行评审,而是直接上传至公开代码库,并在README中写入了修订和引用的协议。

这是对学术验证流程的刻意绕过。它迫使人们面对一个简单但不安的问题:当AI能够解决它发布的内容时,同行评审将何去何从?

AI时代的同行评审

传统同行评审本就是缓慢设计的。人类专家花费数月时间阅读、核查和质疑一份证明,才能赢得学界信任。这种缓慢不是缺陷,而是特性。它确保错误不会传播,并确保主张经过了解该领域细微差别的人的审查。

OpenAI的发布将这一时间线从数年压缩至数秒。前沿模型产生了解答,公司将它们发布给任何人审查。验证责任已从编辑和审稿人转移到全球数学社区——以及任何拥有足够计算能力来运行检查的人。

这种转变既是解放性的,也是不稳定的。数学家现在有机会获得可能耗费数十年才能找到的答案。但没有经过严谨社区验证的证明,只是用LaTeX包装的巧妙猜测。

谁赢谁输

OpenAI立即获益。这次发布展示了能力,引发了头条新闻,并将公司定位为基础科学的推动者——而不仅仅是聊天机器人供应商。平均计算量(三小时Pro思考)听起来 modest,但这是一个精心选择的指标,淡化了前沿模型背后巨大的资源投入。

数学家有条件地获益。已解决的问题无论来源如何都有价值。经得起 scrutiny 的AI证明可以比任何单人研究者更快地推进领域。但这种胜利附带条件:社区现在必须验证可能包含微妙错误、漏洞或训练数据中内嵌假设的输出。

同行评审失去阵地。如果主要实验室开始通过GitHub发布已验证甚至未验证的结果,期刊可能面临变得无关紧要的风险。声誉从同行评审出版物转移到能够负担计算能力和模型的机构。守门人变成了工程师。

还有那个敦促OpenAI采取不同做法的咨询小组。成立于九月的数学与人工智能咨询小组(AGMAI)发布了建议,敦促通过既定学术渠道快速发布,并完全披露模型名称、提示和计算成本。它明确警告不要将数学成果当作营销工具。

OpenAI遵循了快速发布部分,但跳过了学术渠道部分。这究竟是违背精神还是对新技术的实际适应,目前尚无定论。

下一章:验证而非验证

眼前的挑战是验证。数学社区如何验证黑盒模型生成的证明?几条路径正在浮现:

  • 自动定理证明器可以检查逻辑一致性,但它们需要形式化的陈述,可能无法捕捉解题背后的直觉。
  • 专家的抽查可能专注于关键引理,但结果的数量使全面审查变得不可能。
  • 通过GitHub等平台的社区审查允许任何人标记错误,但这依赖于志愿关注和分布不均的专业知识。

这些都没有完全取代同行评审。相反,它们创造了一个混合层:AI生成的草稿、人类增强的验证和开放协作。它更快、更透明,但对任何单一机构的问责性更低。

当AI生成的证明被接受为有效时会发生什么?它能获得与人著作相同的地位吗?它能用于晋升吗?它能获奖吗?社区尚未决定,而OpenAI的发布加速了对这些答案的需求。

次级效应:制度涟漪

除了即时的辩论,还有更深层的结构转变。学术界运营在声誉经济中——期刊、引用次数和机构声望构成了学术成功的货币。当AI系统能够以规模生成可发表质量的成果时,这种货币面临通胀。

大学院系将面临适应压力。本就捉襟见肘的晋升委员会可能发现自己正在评估他们无法完全验证的证明。一些机构可能会加倍坚持纯人类作者标准,而其他机构则可能拥抱区分AI辅助和AI生成贡献的混合评审框架。

基金机构面临类似的困境。 grant审查员通常根据初步成果和方法论稳健性评估拟议工作。如果AI能在 overnight 生成有希望的初步成果,审查员如何区分真正的创新与计算暴力?答案可能在于要求透明度——关于模型来源、训练数据和验证协议——一个尚不存在的标准。

出版商则卡在过时与相关性之间。传统期刊无法与GitHub的速度竞争。一些已开始为AI生成作品实验快速审查通道,而其他则在探索结合预印本发布与延迟同行评审的混合模式。实验尚未找到平衡点。

还有地缘政治层面。OpenAI的发布强化了美国在AI研究中的机构主导地位。欧洲和中国的数学系在计算资源较少的情况下开展工作,将在验证努力方面难以跟上步伐。随着发现工具变得更加普及,全球数学专业知识的分布可能扩大而非缩小。

下一阶段:社区回应与标准

数学社区已经做出回应,尽管是碎片化而非统一的。几个研究组已开始独立验证OpenAI发布的一部分。早期报告表明,虽然许多结果经得起推敲,但有些存在漏洞或依赖数值证据而非正式证明。验证工作是不均衡的——精英机构资金充足的小组比资源不足的研究人员进展更快。

一个日益壮大的数学家联盟正在呼吁新标准:AI验证标记。该提案建议任何AI生成的结果都应显示清晰的徽章,标明其验证状态——是否经过正式检查、部分验证或仍为确认。这一想法从开源软件许可和安全认证中获得灵感,将这些框架应用于数学出版。

期刊正在密切关注。《自然》和《科学》已表示有兴趣报道OpenAI的发布,但两者都尚未宣布评估AI生成投稿的具体政策。美国数学会和其他专业组织预计将在未来几个月发布指南。在此之前,研究人员面临灰色地带:引用未经验证状态的AI生成证明会带来职业风险,而忽略它则意味着可能错过突破性的成果。

超越新闻稿

风险不在于AI会一夜之间取代数学家。风险在于它会取代确保严谨性的流程。同行评审很慢,因为严谨性很难。为了速度而绕过它,是用信任交换节奏。

OpenAI的GitHub存储库包含了修订和引用协议——这是对学术规范的致敬。但没有嵌入同行评审,这些协议是自愿的。任何人都可以发布;任何人都可以纠正。这既是优势也是弱点。

数学社区很可能会通过制定新标准来回应:也许要求AI生成的证明在被引用或接受之前经过某种形式的人类验证。或者期刊可能会为AI辅助作品创建特别版块,带有明确披露和审查标准。

在此之前,OpenAI划下了一条界线。问题不在于AI能否解决数学问题,而在于我们是否还能相信那些来自不理解它最初为何要解决问题的机器的解决方案。

答案将定义未来十年的学术验证。有一点很明确:我们所熟知的同行评审时代已经结束。在其位置上出现的东西——无论是混合验证生态系统还是完全意想不到的东西——将不仅重塑数学,还将重塑知识生产的全部架构。