technology 9 分钟阅读

OpenAI在88小时内实现数学突破:AGI的新压力测试

据称OpenAI在88小时内攻克了一道90年历史的数学难题,这一能力主张可能重新定义我们衡量AI科学推理的方式。真正的问题不在于它能否解决困难问题,而在于它能否提出值得解决的问题。

  • Noam Shazeer
  • AGI
  • 伽罗瓦逆问题
  • 数学突破
  • 科学推理

88小时信号

OpenAI 似乎完成了一件本不该在此时做到的事。据日本媒体 Yahoo News Japan 报道,该公司声称在仅 88 小时的计算中,解决了一个困扰数学界近九十年的问题。若此结果经核实,这不仅是对现有基准测试的微小提升,而是我们对 AI 系统处理高难度、开放式问题的期待发生了结构性转变。

核心数字很简单:九十年的失败被压缩进三天半。然而其蕴含的意义却远非简单。

为何这个问题至关重要

数学不是一道检索题,而是一道生成题。解决一个世纪难题,需要的不只是从训练数据中做模式匹配——还需要发明新结构、在约束条件下检验它们,并识别证明何时完成的能力。这正是"极擅长回答问题"与"能够独立发现"之间的能力鸿沟。

近十年来,AI 研究界一直在合成基准(MATH、GSM8K、AIME)上衡量进步,这些基准测试的是针对精心策划数据集的推理能力。分数一直在攀升。但这些数据集是有限的,其解可能通过训练数据的泄漏进入模型。若结果成立,OpenAI 所声称的是在一个早于训练截止日期存在、且从未被模型见过的难题上展现出的能力。

这是记忆与发明之间的区别。

谁来验证这一声明?

验证将来自数学界,而非 AI 实验室。OpenAI 尚未发布正式论文或可复现的解决方案,这一问题将由在类似领域深耕数十年的数论学家和组合学家 scrutinize(审视)。他们的判断将决定这是真正的突破,还是过拟合、数据污染或未完成的证明通过表面检验所产生的伪像。

OpenAI 所承受的压力现在是单向不对称的。在此声明之前,默认立场是怀疑;在此之后,负担转移了:公司必须提供足够的细节以供独立复现,而社区必须决定,在一个问题上投入 88 小时算力是令人印象深刻、司空见惯,还是具有误导性。

双方都有谨慎行事的动机。数学界不希望夸大一个部分性的结果;OpenAI 也不希望在关乎其相对于 DeepMind、Google DeepMind 及新兴实验室地位的定位宣称上交付不足。

那个无人想要的 AGI 基准

多年来,AGI(人工通用智能)讨论一直被模糊的定义和商业压力所阻碍。“人工通用智能"在它还是一个可测量的概念之前,就变成了一个营销术语。这个 88 小时的结果迫使人们直面一个具体问题:在人类卡壳数代人的领域中,一个 AI 系统能否自主推进人类知识?

如果答案是肯定的,哪怕是部分肯定,那么 AGI 就不再是一篇哲学论文的话题。它是一个带时间戳的工程里程碑。

反之同样鲜明。如果结果无法复现,或者证明中的错误只有人类专家才能发现,那么这一声明将彻底崩塌——而整个领域将失去难以轻易恢复的信誉。

无论如何,基准已经立下了。未来的宣称都将以其为参照。

若结果成立,哪些事情将改变

一个自主数学求解器不只是更快的定理证明器。它是大规模科学 AI 的雏形。破解九十年前猜想所用的同一架构,原则上可以指向材料科学、流行病学或气候建模——那些瓶颈不在计算力、而在创造性假设生成的领域。

发现的经济逻辑同样会改变。今天,一个博士生要花数年学习如何在一个子领域内导航、阅读数千篇论文,并培养对哪些问题值得攻克的感觉。一个能在数天内完成这一切的 AI 系统,改变了谁有机会从事科学研究,也改变了谁拥有这些成果的所有权。

若得到确认,OpenAI 的声明将使其处于这一转型的中心。不是作为工具提供者,而是作为发现者。

风险是真实的

有理由保持谨慎。AI 突破性声明的历史漫长而布满了曾看似辉煌、却在严格测试下崩塌的结果。模型泄漏、合成数据污染、以及针对狭窄任务的过度优化,过去都曾产生虚假阳性。数学界对此早有见识。

此外,单一问题投入 88 小时算力是昂贵的。如果这个方法不能泛化——如果它适用于这一问题但不适用于下一个问题——那么这一声明只是一闪而过的闪光,而非坚实的基础。真正的考验在于,同一系统能否在未经重新训练、无需人类指导、无需精心策划数据集的情况下,解决新的问题。

这场考验还有数月之遥,而非数天。

接下来关注什么

三个信号将决定这是分水岭还是炒作周期:

第一,正式证明。OpenAI 必须发布完整的、可由机器校验的解决方案——或者至少是足以让专家验证的详细推导。没有这些,声明仅是宣传。

第二,泛化能力。同一系统能否处理难度相近、且不属于任何公开数据集的问题?单一结果是轶事,一组模式才是证据。

第三,社区采用。数学家和计算机科学家是用这种方法做出了新的进展,还是这个方法只躺在实验室报告里,而领域早已向前推进?

更大的图景

88 小时的结果不仅仅关乎一个问题。它关乎我们对一台从未以人类方式"学习"过数学的机器能做什么,持有怎样的可能性认知。如果一个 AI 能独立发明证明策略、识别结构性模式,并在几天内推进人类耗时数十年的领域,那么工具与协作者之间的界限,比大多数人意识到的要薄得多。

反之——结果只是一个伪像、一次泄漏或一场误解——也同样值得检验。因为错误的代价不仅仅是信誉的浪费。它是错位的投资、误导的政策,以及一个从此对 AI 宣称长期抱有怀疑的公众。

未来几周将告诉我们哪个故事才是真相。无论如何,基准已经立下了。问题不再是 AI 能否解决难题。问题是它能否解决真正重要的问题——以及我们是否准备好面对那个答案。