日本发现OpenAI最强AI的致命缺陷——西方媒体却忽略了
一家日本游戏媒体率先报道,GPT-6 Astra几乎无法处理《传送门》的物理谜题。真正的启示不在于它
无人预料到的那份报告
9月7日,gamespark.jp发布了一篇报道,其标题所暗示的内容远非其真正价值所在。OpenAI的最新模型GPT-6 Astra——普遍被视为通向通用人工智能的一块垫脚石——能够在不到两小时的游戏时间内击败Valve在2007年推出的益智游戏《传送门》(Portal)。然而,实际的完成时间是二十三小时三十八分钟。这道时间鸿沟,说尽了一切。
GitHub用户cozyblaze记录了这次实验。方法直截了当:运行游戏几秒,暂停,截图,将图像输入GPT-6 Astra,让模型在画面暂停时思考,然后执行模型决定的任何镜头移动和按键操作。重复此过程。共进行六千九百二十五次操作,令牌成本为五百七十一美元。
模型完成了挑战。但它如何完成,远比完成本身更值得关注。
物理学的难题
一段记录此次尝试的YouTube视频显示,GPT-6 Astra使用传送枪的动作相当利落。它能在墙壁和地板上放置传送门,穿越房间,解决《传送门》旨在教授的那种空间逻辑谜题。然而它踉跄跌倒的地方——以及这恰恰是任何关注前沿AI能力的人都应警醒之处——在于动量。
移动平台、速度依赖型谜题、以及正确动作取决于理解离开表面后你将滑行多远的情境。模型会犹豫、误判,有时甚至会踩入它本应避免的边缘。
这不是一个次要的失败模式。这是一个结构性的缺陷。
GPT-6 Astra处理的是单个画面。它并不维持一个关于运动中物体随时间变化的连续内部模型。每一次决策都是一件披着推理语言外衣的离散分类任务。模型能理解平台在移动,但它无法轻易模拟踏上平台后、携带动量跨越间隙时会发生什么。这并非数据问题。这是架构问题。
其影响远超一款益智游戏。《传送门》基于动量的设计迫使玩家内化他们无法看见的物理规律——计算轨迹、估计速度传递、信任此刻的行动将在未来产生特定的结果。人类玩家通过具身实践发展出这种直觉。模型则毫无此类积累。它只看到一帧画面,预测一个动作。它无法从一个瞬间到下一个瞬间保持对世界的连贯认知。
研究AI对齐与鲁棒性的学者早已警告,当被推向新颖情境时,依赖模式匹配的系统会以可预测的方式失效。《传送门》实验将这一切实时呈现。看着模型进入一个有移动平台的房间,看着它将问题当作静态来处理。平台在移动,模型却不作调整。它根据平台原来的位置而非它将到达的位置发射传送门。这不是漏洞。这是快照式推理系统的自然输出。
为何日本率先报道
西方媒体对GPT-6 Astra的发布一直是用宏观笔触勾勒——基准测试分数、接近AGI的头版标题、以及那些陈词滥调。尚无主要英文出版物报道过此次《传送门》实验。而深耕日本游戏新闻的站点Gamespark做了。
作者K.K.是一名心理学毕业生,自2022年起为该站报道游戏。他的个人简介提到他喜爱科幻、开放世界游戏和军事小说。他还坦言自己对别人的 romantic feelings(浪漫情愫)较为迟钝,但能更好地理解动物的情绪——然后又把这归咎于自己没有尾巴或耳朵。报道本身客观克制,但它被归类于“游戏中AI能力”板块之下,而这正是此故事理应所在的板块。
报道缺位的根源不在于质量,而在于注意力。西方科技媒体正以近乎狂热的姿态追逐AGI叙事,几乎没有空间留给那种细致、不够光鲜、却能真正揭示模型能力边界的测试。一家日本游戏媒体用AI代理进行《传送门》速通实验,这与头版新闻背道而驰。它更像是个脚注。正因如此,它才被写出来。
此外,还有一个值得注意的结构性原因。日本有着将电子游戏视为值得严谨分析的重要文化对象的悠久传统。那里的游戏新闻倾向于优先考虑工艺、机制和玩家体验,而非炒作周期。当一家游戏媒体测试AI与益智游戏的对抗时,它切入问题的角度与科技博客从市场颠覆或能力里程碑角度切入截然不同。日本媒体的报道聚焦于AI 玩得怎样,而非它是否代表了一项突破。这种框架上的差异本身,就是一种信号。
一次思考的成本
花费571美元完成《传送门》并非小数目。但如果你理解其内在机制,这也不令人惊讶。六千九百二十五次操作中,每一次都需要图像输入和文本输出。模型在思考时会让游戏暂停。在一款能让熟练玩家在不到三分钟内通关最终房间的现实游戏中,GPT-6 Astra用于纯粹决策的时间约为二十二小时。
大多数决策是正确的。但大多数都不快。模型以一种人类玩家无需采用的方式,用计算量换取推理时间。人类看到移动平台,无需计算便知道能否跳过。模型看到静态画面,将其送入推理流程,然后生成动作。其中的差异并非智力,而是具身性。
这次实验的财务成本引出了一个报道大多忽略的实用问题:这种路径在何种程度下,才能超越猎奇实验而具备可行性?571美元对于《传送门》而言已属昂贵。若将其扩展至更复杂的环境——一款需要数百小时交互、多个物理系统、动态环境变化的游戏——令牌成本将变得令人望而却步。即使是GPT-6 Astra也无法无限期地维持这一策略。这项实验之所以令人印象深刻, precisely because it is uneconomical(恰恰因为它的经济性很差)。
连锁反应
《传送门》实验将在多个社区引发涟漪,而这些影响已经初现端倪。速通社区花了数十年时间,通过利用游戏漏洞和帧级精准输入来优化《传送门》的通关速度,他们对这次AI速通的态度混合着迷与不屑。一些人视其为一种新的玩法类别;另一些人则视其为在一个为人类表达而设计的空间里进行竞争的非玩家。这两种观点之间的张力具有建设性,它促使人们展开一场关于“在互动系统中何谓成就”的对话。
AI安全研究人员则出于不同的原因在关注此事。这里观察到的失败模式——动量误判、缺乏时间连续性、过度依赖静态推理——与这些模型部署于机器人学、自主系统和医疗诊断时所出现的错误类型属于同一范畴。一个在简单游戏中都无法可靠追踪变化物理规律的模型,不太可能应对现实世界中持续的复杂性。《传送门》实验规模虽小,但它携带的警示却不容忽视。
还有一个经济层面的因素。每次实验571美元的成本,给由OpenAI和其他实验室构建的基准测试工业化带来了压力。如果最具说服力的推理测试需要每分钟数千次离散推理调用,验证成本将呈非线性增长。这可能激励人们去开发更便宜但诚实度更低的基准测试——那种测量表面模式匹配而非真正推理能力的测试。《传送门》实验因其昂贵和缓慢,无意中凸显了当前评估生态系统的脆弱性。
接下来会发生什么
cozyblaze表示他们想对《传送门2》进行同样的实验。这值得关注。《传送门2》引入了更复杂的动量谜题、需要时机把握的环境危险,以及要求跨章节记忆的剧情结构。如果GPT-6 Astra连基本的移动平台都处理困难,《传送门2》将更加严苛地暴露其局限性。续作还加入了改变物理属性的凝胶、根据玩家放置而变化的传送门兼容表面,以及需要战术推理线之视野和换弹周期的炮台。每一个新机制,都是对一个已在简单层面就显蹒跚的系统施加的压力测试。
更广泛地说,这项实验揭示了一个AGI讨论持续忽视的事实。通过一项基准测试——即使是一项精巧设计的测试——并不意味着模型理解了世界。它只是意味着模型学会了在特定情境中将视觉输入映射到行动输出。模型解决了《传送门》。但它并非以人类的方式解决。它以一台极其昂贵的计算器的方式解决:逐帧、暂停、逐美元地解决。
这里真正的故事并非GPT-6 Astra能玩《传送门》。而是西方媒体完全错过了这份报告,且嵌入在这项成功中的失败模式,正是任何关注这些系统是在逼近通用推理、还是仅仅在受限环境中变得更擅长模式匹配的人,最应关心的要点。
日本已经知晓。问题在于,世界其他地区是会迎头赶上,还是下一次至关重要的实验将继续无人问津,而所有人都只盯着那些无关紧要的亮点集锦。