69岁图灵奖得主Richard Sutton另起炉灶:20瓦功耗实现万亿参数实时学习
在人工智能技术狂飙突进的第11年,一场关于“智能本质”的范式辩论正在悄然升级。当整个行业沉迷于通过堆砌算力与数据来扩展模型边界时,强化学习领域的奠基人、2024年图灵奖得主Richard Sutton却选择了截然不同的路径。这位69岁的学术巨匠宣布,他与长期合作伙伴Khurram Javed已离开John Carmack创办的Keen Technologies,正式创立Oak Lab。这一举动不仅标志着两位顶尖专家的技术理念分歧,更预示着AI研发重心正从“离线预训练”向“在线实时进化”迁移。

Sutton的此次创业并非一时冲动,而是基于其四十余年对智能机制的深刻洞察。他曾直言,当前的深度学习方法在通往通用人工智能(AGI)的道路上存在根本性的薄弱与低效。现有的主流范式依赖于耗费数月时间、投入巨额成本的海量文本数据预训练,模型一旦训练完成,参数即被固化。尽管模型在上线后能通过用户交互获得反馈,但这些交互数据往往无法转化为模型内在的结构性知识更新。这种“学习”与“运行”的割裂,使得现有系统难以像生物体一样,在持续感知环境的过程中动态调整自我,实现真正的自适应智能。

Oak Lab的核心愿景极具挑战性:构建一个万亿参数规模、能够实时学习与实时规划的智能体,且其整机功耗需控制在20瓦左右——这恰好与人类大脑的基础代谢能耗持平。这一目标直指当前AI行业的痛点:高能耗、低能效与知识固化。Sutton认为,只有重新定义智能的运行机制,才能在有限的物理约束下,实现算力与认知的最优匹配。

要理解Sutton的决裂,需回顾其与Keen Technologies的合作历程。Keen的创始人John Carmack是游戏引擎与虚拟现实领域的传奇人物,早在2022年便从Meta离职投身AI创业,方向同样聚焦于强化学习。2023年,在谷歌DeepMind关闭其在加拿大艾德蒙顿的实验室后,Sutton加入Keen,两人曾计划联手打造具备“AGI生命迹象”的原型系统。然而,合作不到三年,双方在技术路线上的分歧日益显现。Sutton在公开推文中虽对Carmack给予高度评价,但也明确表达了对现有深度学习路线的质疑。在他看来,修补现有的深度神经网络无法解决根本问题,行业亟需一场范式层面的颠覆与重建。

Oak Lab的技术核心围绕其提出的OaK架构(Options and Knowledge,即技能与知识)展开。该架构的设计初衷是让智能体能够从自身运行产生的经验中,自动提取具有时间跨度的抽象结构,并将其转化为可验证、可规划、可复用的底层技能。以机器人执行“接水”任务为例,传统AI往往将识别房间、躲避障碍、抓取水杯、打开龙头等一系列动作视为单一的决策序列;而OaK架构则能将这些离散动作解构为“移动至厨房”、“抓取容器”、“注水”等高阶技能模块。当面临类似任务时,智能体不再从零开始计算,而是直接调用并组合已有技能,结合当前环境状态进行动态调整。
这种机制被称为“时间抽象”,它模拟了人类将复杂动作沉淀为肌肉记忆与操作技能的认知过程。更为关键的是,OaK架构在数据利用方式上做出了激进的创新:摒弃传统深度强化学习中广泛使用的经验回放缓冲区(Experience Replay)。传统方法通常将大量历史数据存储下来,进行多次抽样训练;而Oak Lab主张采用Batch Size为1的实时在线学习机制。即每获取一条新的环境交互经验,系统立即完成一次参数更新。这种设计大幅降低了存储需求与计算延迟,若进一步结合事件驱动神经网络,有望将系统所需的计算量与能耗降低数个数量级。
支撑这一激进技术路线的,是Sutton与Javed共同提出的“大世界假说”(Big World Hypothesis)。该假说认为,真实世界永远比任何预训练模型所涵盖的数据更为复杂且处于动态变化中。随着AI能力的提升,环境中的数据维度与不确定性同样会呈指数级增长。依赖静态、离线数据集训练出的模型,注定无法跟上现实世界的变化速度。因此,AI必须学会选择性记忆有用信息,适时遗忘过时内容,并通过持续的在线交互来更新认知。这种“经验时代”的到来,意味着智能的源泉将从人类标注的数据集,转向智能体与环境互动所产生的实时经验。

这一观点并非Sutton的首创,而是其早期思想的自然延伸。2019年,Sutton发表的《苦涩的教训》一文曾引发广泛讨论,指出依靠计算规模扩展的通用学习方法终将胜过依赖人类手工知识的系统。然而,Sutton指出,当前的大模型虽然验证了算力与数据的重要性,但仍高度依赖人类历史数据的整理与筛选。真正的智能体,应当是通过自身行动产生新经验,并利用这些经验追求长期目标。2025年,他与AlphaGo核心设计者David Silver联合提出的观点进一步强调,AI的发展重心应从“数据驱动”转向“经验驱动”。Oak Lab正是这一理论主张的创业化落地实践。

从40年前在博士论文中探讨“时序信用分配”问题,到如今在AGI浪潮中另辟蹊径,Sutton始终在追问同一个核心命题:智能究竟是如何产生的?他的回答是,智能源于持续的经验积累与在线适应。随着Oak Lab的成立,AI行业正面临一个重要的分岔口:是继续在现有的深度神经网络基础上进行增量式优化,还是彻底重构底层架构,以契合生物智能的运行规律?
目前,Oak Lab的研究仍处于早期阶段,万亿参数与20瓦功耗的目标尚属远期构想。但Sutton的介入无疑为该领域注入了强大的理论背书与学术关注度。近期,他已确定出席上海世界人工智能大会(WAIC),并将带来题为《强化学习的第一性:从经验培育超级智能》的主题演讲。此次演讲预计将详细阐述Oak Lab如何在理论层面突破现有瓶颈,以及工程上如何实现高效能智能体的构建。
对于整个AI产业而言,Sutton的出走与创业具有多重信号意义。首先,它揭示了头部研究机构对当前主流模型路线瓶颈的深层忧虑;其次,它证明了强化学习并未因大模型的兴起而衰落,反而在与认知科学、能效计算的结合中找到了新的生长点;最后,它提示行业关注点应从单纯的参数规模竞赛,转向系统级的能效优化与实时学习能力。
尽管挑战巨大,但Oak Lab所代表的“实时、低耗、在线学习”方向,极有可能成为下一代通用人工智能的重要基础设施。如果Sutton的理论能够通过工程实践得到验证,那么未来的AI系统将不再是封闭在服务器机房中的静态知识库,而是嵌入在物理世界中、拥有持续进化能力的智能代理。这不仅是对技术的革新,更是对“智能”定义的重新书写。在这场关于智能本质的探索中,69岁的Sutton依然站在潮头,试图用20瓦的能量,点亮通往真正通用智能的路径。