science 9 分钟阅读

萨顿的20瓦赌注:万亿参数大脑为何能颠覆AI

理查德·萨顿认为当下的AI陷入了停滞——模型部署那一刻学习便停止,而行业对数据饥渴的答案不过是又一个错误。他的反提案是:以接近大脑的功耗水平实现持续学习。问题在于,Oak Lab能否证实这一点。

  • 理查德·萨顿
  • AI效率
  • 持续学习
  • LLM
  • 合成数据
  • AI Paradigm

20瓦的炸弹

理查德·萨顿(Richard Sutton)刚刚向AI世界宣告:过去四年的一切建设,不过是一条歧路。

强化学习领域的 citation 之王——那个为 DeepMind 奠定理论根基、写下被许多人称为领域知识宣言的《苦味教训》(The Bitter Lesson)的人——断言当前以大型语言模型为中心的研究范式从根本上就是错的。而他不只是在诊断,他还选择了离开。通过 Sequoia Capital 的一期播客,萨顿宣布创立 Oak Lab,一家围绕他所谓"极其简单"的理念构建的初创公司:智能不需要兆瓦级电力,它需要的是一种功耗仅20瓦的持续学习。

这个数字——20瓦——是人类大脑的功耗预算。你的冰箱比它耗电更多。一座容纳单个大语言模型的数据中心,耗电量足以照亮一个小镇。萨顿的论点毫不客气:如果你能用20瓦做到这些,整个算力军备竞赛就成了多余。

诊断:停止学习的系统

萨顿最尖锐的批评指向大多数用户从未察觉的一件事——因为它是当今所有部署版大语言模型的默认状态。一旦模型被冻结并交付,它就停止了学习。它不会适应,不会进步,也不会遗忘,而这另一种说法就是:它没有生命。

这就是萨顿所说的"致命缺陷":那些号称具备博士级专业知识的系统,在进入生产环境的瞬间便停止了知识积累。它们本质上是会说话的纪念碑。

他的替代方案是"持续学习"——模型通过与环境的交互持续更新权重,就像大脑一样。不是在静态数据集上做微调,也不是用人类偏好做强化学习人类反馈(RLHF),而是由环境反馈驱动的、真正持续的权重更新。

最显而易见的反驳是灾难性遗忘——神经网络上在学习新信息时会覆盖已有知识的著名问题。萨顿正面回应了这一点。他提出的解决方案是一种称为"持续反向传播"的算法,为每个网络权重分配独立的个性化学习率,在保留现有知识的同时注入随机新单元,以实现持续适应。

理论上听起来合理。问题是它能否扩展。

合成数据是一座陷阱

萨顿的批评还延伸至行业应对数据枯竭的当前方案:合成数据。他毫不客气地将其驳回——“就是个巨大的错误”——他的合作者库拉姆·扎维德(Kuram Zaveed)也从逻辑上支持这一观点。验证合成数据最终需要人类专家判断,这就形成了一个瓶颈,使得整个经济模型随之崩塌。

正是在这里,萨顿的"大世界假说"发挥了核心作用。物理世界的复杂性远超任何人类能够构建的模拟。人类制造的模拟,从定义上就受限于人类的理解边界。你无法通过合成手段解决一个你自身无法完全建模的复杂性问题。

这个推论对目前押注数十亿美元构建数据生成管道的每一家AI公司来说都极为不适。如果萨顿说得对,那些管道并没有解决数据问题——它们只是把问题往后推移了一步,转移到了人类劳动上,而人类劳动本身也会成为新的约束。

谁被颠覆了

萨顿与扎维德的立场直击主导AI叙事的核心:规模是唯一通往智能的路径。每家头部实验室都在竞相构建更大的模型、投入更长的训练时间、消耗更多的资金。他们的理由是智能是算力的函数——更多参数、更多token、更多浮点运算量。

萨顿说这是范畴错误。正如他在2019年《苦味教训》中一直主张的,智能是擅长利用计算的高效算法的函数——而非计算本身的函数。苦味教训从来都是:通过通用算法自动化搜索和学习的策略,一致性地优于手工设计的方法。他说,当前的范式不过是在超大规模上的手工设计方法。

对科技巨头而言,威胁是生存级别的,而这正是多数媒体报道所遗漏的。如果持续学习能够实现大规模预训练所声称实现的目标——而且能耗只有其一小部分——那么建立在GPU容量和数据获取之上的护城河将瞬间蒸发。优势将从最能花钱的人转移到最能学习的人。

这就是 Sequoia 的投资至关重要。这不是一桩学术玩具。Oak Lab 是作为一家公司来建立的,而不是一个研究小组。

最难的部分:证明它有效

扎维德对工程差距直言不讳。受限于当前的内存架构,用20瓦存储万亿级参数目前是不可能的。他给出的预期时间是5到10年。在AI的时间尺度上,一年可以看起来像十年,这是一条漫长的跑道。

萨顿在讨论中还做了一个发人深省的框架选择:当批评者称他的立场为"激进"时,他回应说自己坚守的才是平淡无奇的正统观点,是领域疯了。他以松鼠在物理障碍中穿行为例,说明传感器运动智能——那种需要在复杂世界中进行实时交互的智能——远远超出了当前基于语言的系统。他认为语言仅占真正智能的约20%。

这是对当前主导行业的"大语言模型即通用人工智能"叙事的直接挑战。他将萨顿坚定地归入了认为具身交互学习才是缺失关键环节的那一派——这一立场由少数研究者共享,却被资本市场 largely ignored。

接下来会发生什么

短期影响有限。Oak Lab 处于早期阶段,算法声明尚未经过同行评审或独立复现,20瓦的目标仍是愿景。没有人应该将其解读为对重度算力范式的近期威胁。

但长期信号清晰。萨顿是强化学习领域最受尊敬的理论家之一,从不惧怕挑战正统。他的参与、并投身于一家基于替代架构的初创公司,让这个替代方案获得了大多数新思路所无法企及的可信度。如果 Oak Lab 能证明哪怕部分成功——一个能在有意义能效提升的前提下持续学习且避免灾难性遗忘的模型——整个大规模训练的投资逻辑都将面临审视。

20瓦目标所对应的时间线几乎可以肯定是过于乐观的。但方向毫不含糊:问题不在于领域是否会最终纳入持续学习的原理,而在于当前的范式是被彻底瓦解,还是仅仅被它们增补。

萨顿会说,答案我们早已知道。而他的批评者们还在写论文。