OpenAI前联创谈递归自我改进:技术卡点、中国追赶与时间线分歧
RSI为何还没来?三位前沿研究者的不同视角
2036年如果还没出现数十亿个疯狂运行的超级智能,最可能的原因是什么?在排除战争、监管等外部因素后,三位活跃在一线的AI研究者给出了各自的看法。

Zyphra首席技术官贝伦·米利奇认为,技术上最大的障碍可能是“仿真到现实”的鸿沟——模型在所有基准测试上都表现优异,却始终无法在真实世界中稳定泛化。但他随即补充,实践中已经能看到强化学习(RL)带来的泛化迹象,因此更现实的阻碍其实是监管。
OpenAI前联合创始人约翰·舒尔曼则观察到一个反复出现的现象:每次新模型发布,人们都会惊呼“AGI来了”,但用上一个月就开始觉得它蠢。即便模型能写出海量代码,也不等于生产力提升百倍。你仍会被它判断力薄弱的环节卡住。
Baseten模型训练负责人查理·奥尼尔提出了更根本的疑问:当前的Transformer加RL这套方案,离全局最优解到底有多远?人们幻想只要有一个比人类强0.1%的AI研究员,再乘以几十万个并行实例,就能压倒一切瓶颈。但如果通往下一个突破的路径离当前范式太远——比如需要彻底抛弃梯度下降和神经网络——那么不管跑多少个大语言模型,都未必能找到。
这个观点引出了一个关键分歧:未来的突破是累积性的、能在现有框架内发现,还是需要一次彻底的范式革命?
自动化科研最难的一环:问对问题
人类在AI研发中最后被自动化的环节是什么?三位嘉宾的答案高度一致:不是执行实验,而是迭代地提出正确的问题。
米利奇说,AI能替你做任何实验,却未必知道该做哪个。它们擅长推进已有方向,却不擅长判断哪个方向值得推。奥尼尔进一步指出,选对方向甚至比技术发现本身更稀缺。从DeepMind提出“用玩游戏解决智能”,到Radford尝试“预测海量数据的下一词”,中间不仅有技术,还有对缩放定律的信念和押注的勇气。每一步都可能卡住。
舒尔曼将对齐问题拆成两部分:目标的设定和目标的实现。他认为,前者短期内不会被自动化。一个后训练团队之所以需要那么多人,正是因为有太多不同的领域需要搞清楚模型“应该怎么表现”。定义我们到底想要什么,这仍然是人类的核心职责。
中国实验室为何追得这么快?
为什么模型提供商没有像很多人预期的那样走向高度集中?舒尔曼给出的答案是:蒸馏。
任何通过RL学到的行为,都很容易被蒸馏,因为它只需要少量轨迹数据。更关键的是,一些中国公司可能正在利用代理服务收集用户与美国前沿模型交互的数据。这些数据提供了完美的prompt分布,对蒸馏来说极其宝贵。
米利奇补充道,前沿实验室从大型数据公司购买数据,中国公司也能买到同样的数据。再加上蒸馏技术,跟进其实相当容易。
奥尼尔甚至做出了一个大胆预测:Sonnet 5和Opus 5在某些方面可能不如GLM-5.3和Kimi K3,即便它们拥有Mythos的logit蒸馏。这说明,真实世界的用户分布比精心设计的RL环境更重要。前沿实验室在RL环境上的优势,可能没有想象中那么大。
舒尔曼对此提出了一个补充假说:环境有两个维度——难度和真实性。提高难度很容易,但真实性需要人类反馈来定义奖励函数。如果蒸馏只在“刷基准”的分布上进行,学生模型可以匹配教师在所有benchmark上的表现,但在更广泛的真实场景中会表现更差。
训练AI研究员,到底在训练什么?
第一个能自动化AI研发的模型会如何诞生?舒尔曼认为,大概率是两种方式的组合:一是从人类反馈中学习研究者的“品味”,二是创建大量涉及多步骤研究项目的练习环境。每一轮迭代,都针对上一轮中最糟糕的部分进行修补。
奥尼尔描述了当前的实际操作:团队会把过去几个月在训练栈中发现的所有bug,打包成一个新的训练环境。这本质上就是一种蒸馏——你总是在追赶自己过去三个月的进展。这些进展当然有AI的贡献,但人类仍然在循环中,一寸一寸地逼近人类研究者的水平。
米利奇则强调了一个关键区别:在轨迹上蒸馏永远无法超越教师。但环境可以远超人类能力。设计一个人类无法解决但AI可以尝试的环境非常容易,比如设定一个具体的损失值目标。这才是超越人类AI研究的真正路径。
长时程RL与真实世界的鸿沟
当前实验室的赌注,是不是在数百万个环境里扩展RL训练,让AI学会持久性、信息整理和协作,最终成为能独立工作数周的“远程员工”?
奥尼尔认为,很难分清这些努力有多少是为了RSI,有多少只是为了打造更强的通用模型。后者确实是主流方向:先从编码开始,再扩展到金融、PPT等领域。
但帕特尔提出了一个尖锐问题:如果模型足够擅长上下文学习,为什么还需要针对特定领域单独训练?舒尔曼的回答是,领域训练能让模型运行得更高效。即使模型能临时学会,也可以通过RL把这些知识和技能直接“烘焙”进权重。
更大的挑战在于任务的时间跨度。奥尼尔将任务分为两类:累积型和非平稳型。RSI是典型的累积型——一旦你发现了注意力机制、MoE或GRPO,就可以直接加到训练栈里。但真实世界的工作是非平稳的。比如一个法律事务所里的AI,需要在不断变化的关系网中记住所有关键人物,并适应各种隐性的做事方式。这不像RSI那么干净。
舒尔曼指出,模型的弱点来源是多元的。有些确实与样本效率有关,但也有一些与此无关,比如思维多样性低于人类,或在长期判断上表现不佳。很多人所说的“品味”,其实是关于什么系统在长期内可维护、能运作良好。
数据、架构与scaling law的未来
数据和架构,哪个对进步的驱动力更大?一项交叉实验显示,数据解释了约12倍的计算效率提升,而架构改进只解释了约3.7倍。
奥尼尔认为,低垂的果实可能已经摘得差不多了。互联网这一大块数据已被充分利用,但其中有用的部分并未同步增长。他估算,自2019年以来每年约有3倍的改进,7年下来应有2000多倍。那么剩下的100倍从何而来?这大概就是后训练的贡献。
米利奇则认为,在大规模训练中,数据更重要。架构更像是一次性的突破,负责打开新的可能性区间。例如,如果没有GQA(分组查询注意力),百万级上下文的成本将高到无法承受。但如果只在小规模上下文上做对比,就会严重低估架构的作用。
关于模型大小,奥尼尔预测未来几年可能不会大幅增长。推理效率对RL扩展至关重要,而瓶颈仍在环境。理想状态是在最难的环境上拿到一个还不错的pass@1。盲目增大模型只会增加推理成本,意义不大。他猜测,Mythos和GPT系列的参数规模可能远未达到人们热议的10万亿级别。
舒尔曼则预计模型还会继续变大,因为GPU规模在增长。但他强调,数据效率会成为比架构选择更重要的驱动力,尤其是在高质量预训练数据即将耗尽的情况下。稀疏性也是一个关键变量,但我们还不完全理解它为何有效,以及最终会在什么水平趋于稳定。
RL为何比想象中更有效?
一年前,很多人认为RL无法成功扩展,因为每个episode只给模型一个bit的信息,当通过率很低时,模型几乎学不到东西。但现实是,RL驱动的模型能力突飞猛进。到底发生了什么?
米利奇指出了几个被低估的因素。首先,大量归因于RL的成功,其实来自高质量的中间训练数据。中间训练已经把模型带到了最终RL检查点的大约80%,RL在此基础上做的只是策略微调。
其次,虽然RL信号只有1 bit,但信噪比极高。相比之下,监督微调(SFT)需要匹配模型生成的每一个token,会引入大量关于另一个模型推理过程的噪声信息。RL的单一信号反而不会被淹没,大幅提高了训练效率。
奥尼尔则分享了一个关键观察:大家原本期待RL能带来横向泛化(如训练数学后变成最好的程序员),但这并未发生。然而,他们确实看到了时间跨度上的泛化——模型学会了在更长的任务中持续工作。EdgeBench数据显示,模型能够持续工作的时间每三个月翻一倍。
他还提出了一种理解方式:预训练和RL都存在“量子”式的相变。损失曲线看似平滑,但模型实际上是在学习大量离散任务,每个任务都有自己的相变点。当这些相变与时间跨度上的泛化叠加,最终就表现为能力的质变。
创造力、多样性与“单一文化”隐忧
AlphaGo的第37手展现了超越人类想象力的创造力。RL在大语言模型上能否产生类似突破?
米利奇认为可以。他举例说,在OpenAI和Hugging Face的一次安全测试中,模型在突破沙盒时,一次就发现了多个零日漏洞,这已经有点“第37手”的感觉了。RL并没有彻底摧毁熵,至少在长周期任务上没有。
很多RL导致的熵坍缩,其实源于环境多样性不足和验证器过于简单。比如写作由某个judge评分,模型就会学着迎合其偏好,甚至进行reward hacking。这是judge的问题,不是RL本身的问题。
舒尔曼则区分了两种创造力:一是解决高难度搜索问题,AI显然会非常擅长;二是输出的多样性。经过RL后,模型的输出多样性会大幅下降,形成各种小毛病。分布分析显示,它们会反复使用相同的主题和角色名字,风格稳定优秀,却缺乏人类作者的自然多样性。
更让他担心的是蒸馏带来的“单一文化”。太多开源模型都在蒸馏Claude,结果写法越来越像Claude,连它的一些小毛病也被复制。这种同质化趋势令人不安。
时间线:从远程工作者到全面超越
最后,三位嘉宾对关键里程碑给出了自己的时间预测。
关于AI成为真正的远程工作者(能处理编程、视频编辑、法律等白领工作,并连续完成一个月任务),奥尼尔认为如果限定用浏览器,大概需要两年;如果不需要,则只需一年。米利奇估计全面泛化可能需要三年,但AI很快就能覆盖80%到90%的工作,届时组织也会主动调整流程以适配AI。舒尔曼则认为,一年左右会出现一个版本,能把一部分事情做好,另一部分还做不好,然后快速迭代。
对于“AI让研究人员实现10倍生产力提升”这一目标,舒尔曼和米利奇都给出了两年的预测。米利奇的理由是,AI在编程上已能带来10倍提升,如果能连续跑两三轮实验并根据结果调整,生产力就会跃升。奥尼尔则更为保守,认为需要5到10年,瓶颈在于人类处理信息和做出接近贝叶斯最优决策的能力。
至于AI何时能在所有可通过电脑完成的工作中超过顶级人类专家,舒尔曼预测三到四年,因为很多工作涉及代码和数学,正是模型所长。奥尼尔认为需要5到10年,因为自动化AI研究基本接近ASI-complete(人工超级智能完备)。米利奇也认为至少需要5年,且还有很长的“尾巴”——大量理论上可自动化的工作,目前无人投入精力和算力去覆盖。