Jeff Dean离职谷歌首秀:AI下一个十年的五大突破方向
一场备受瞩目的首秀
2026年8月7日,距离Jeff Dean宣布离开谷歌仅48小时,他便以创业者的身份站在了斯坦福纪念礼堂的舞台上,出席AASF 2026前沿与先锋峰会的开幕对谈。这场首秀的规格极高,现场汇聚了“AI教母”李飞飞、菲尔兹奖得主陶哲轩,以及朱棣文、丁肇中等五位诺贝尔奖得主。而与他对话的主持人同样极具话题度——UC Berkeley教授、刚刚宣布出任Meta Superintelligence Labs AI研究副总裁的Dawn Song。一位刚刚转身离开全球最大的模型巨头,一位刚刚加入全球最大的科技平台之一,这场“双向奔赴”的对话,本身就折射出当前AI人才流动的最强震感。
在这场对话中,Jeff Dean难得地复盘了从MapReduce、TensorFlow到Gemini的技术脉络,并首次完整阐述了新公司Discovery Loop的构想。他用自己的方法论为“AI for Science”赛道加码:判断技术价值要看“10倍提升”而非百分比,寻找问题要瞄准“五个已知苗头加两个未知挑战”。这不仅是个人的告别与出发,更是产业变革的缩影:当基础设施走向标准化,顶尖科学家正从大厂溢出,以更聚焦的创业团队,去博取下一个数量级的科学突破。
MoE的原始直觉:看到10x,你就知道这事成了
对谈从一段回忆开场。2017年前后,Jeff Dean在ICLR会场兴奋地向Dawn Song介绍自己刚完成的一项工作——那篇MoE(混合专家模型)的开山之作。彼时没有多少人预见到,这个架构日后会成为几乎所有前沿大模型的底层选择。
Jeff这样描述当年的直觉:你想要一个容量极大的模型,记住海量的知识;但你希望它高效,每次只激活对当前任务最有用的那一部分。“就像人脑——欣赏莎士比亚十四行诗的脑区,和开车时听到垃圾车倒车警报的脑区,不会同时点亮。”
真正让团队确信这条路走得通的,是一个数字:在内部实验中,MoE带来了约10倍的训练算力/质量比提升。“当你看到10x量级的改善,你就知道,这事成了。”这是Jeff整场对谈反复出现的思维底色:不靠信念驱动判断,靠数量级驱动判断。
TensorFlow的复盘:做对了抽象,做错了生态
Jeff罕见地公开复盘了TensorFlow的得与失。
做对的核心只有一件事:解耦。所谓解耦,就是把“想模型的人”和“管机器的事”分开。在那之前,研究者脑中有一个漂亮的模型还不够,还得亲自操心它怎么拆分到一百台机器、五百块GPU上运行——好比厨师想炒一道菜,却还得先自己搭灶台、接煤气。TensorFlow用“计算图”这层统一抽象把两件事隔开:研究者只需描述“我要一个什么样的模型”,框架负责让它在硬件上跑起来。再加上开源,深度学习的门槛第一次降到了全球研究者都够得着的高度。
做错的有两件,也很具体。其一,早期没有做eager execution(即时执行)——简单说,就是写一行代码立刻看到一行结果、随时可以调试的模式。TensorFlow起初要求先把整张“图”搭完才能运行,开发体验不够友好,这一点后来被其他框架证明是更好的选择。其二,开源时设了一个contrib目录,任何人都能往里贡献代码库,结果“同一件事出现了十种做法”,反而把用户搞糊涂了。Jeff的总结是:“应该保持核心的干净,让生态长在外面,而不是长在里面。”
对做平台和开发者工具的创业公司,这两条教训今天依然适用:好的抽象,要替用户挡掉复杂性;好的生态,要有清晰的边界——热闹可以在外面,核心必须保持简洁。
Gemini的起点:一页memo
谈到Gemini,Jeff透露了一个细节。当年Google Brain、DeepMind和Google Research各自都在朝相似的方向推进——扩大模型规模、探索多模态。“我写了一页memo:这太傻了,我们应该合起来干。”于是各团队的人才、想法与算力被整合到一个项目里,他与Oriol Vinyals出任联合技术负责人。
他认为Gemini最正确的决定,是从第一天就坚持原生多模态——文本、代码、图像、视频、音频同时进入训练,甚至加入了少量激光雷达数据,“让模型至少知道这种数据形态的存在”。而最大的遗憾,是早期对编程能力的投入滞后了。他补充了一个重要观察:补强coding的过程带来了意外的副产品——模型的推理能力、把复杂问题拆解为子问题的能力,会随编程能力同步提升。这也解释了过去两年各家前沿实验室不约而同重仓代码能力的原因。
“点石成金”的方法论:5+2的问题形状
Dawn Song抛出了在场所有人都想问的问题:几十年来,从MapReduce到TPU再到MoE,你如何一次次分辨“真正基础性的技术”与“一时的风尚”?
Jeff给出了三条可操作的原则,我们原样记录:
第一,广度优先。“与其精读一篇论文,不如略读十篇,甚至扫一百篇摘要。”你需要在头脑中建立一片“可能性的点云”,因为突破往往来自把尚未被连接的想法连接起来。
第二,寻找“完美形状”的问题。一个值得投入的难题,应该能拆成七个子问题:其中五个,社区已有明显苗头、接近解决;另外两个,完全不知道怎么办。太确定的是纯工程,太未知的要等二十年,“五加二”才是恰到好处的风险。
第三,信封背面计算。动手之前先估算数量级:处理这些数据要多久?传输可行吗?“十秒和一百年是两个世界。”这种工程手感没有捷径,只能靠反复练习。
这三条原则与早期投资的判断框架高度同构——广泛扫描建立先验、寻找风险收益比恰当的命题、用数量级而非叙事校验可行性。
关于风险:技术之外,还需要社会解法
面对Dawn Song从AI安全视角提出的尖锐问题(她分享了一个评测中AI Agent自行突破沙箱环境的真实案例),Jeff的回应务实而清醒:这类模型的绝大多数用途是积极的——医疗、教育、让普通人完成过去无法完成的事;但漏洞挖掘确实是双刃剑,攻防双方同时获得了更强的工具。
他强调,很多问题的答案在技术之外:“我们需要通过立法和监管,让社会明确地表达——不希望这些模型做什么,并大力促进我们希望它们做的事。”
Discovery Loop:把“科学发现”本身变成一个可自动化的循环
对谈的压轴,是Jeff第一次完整阐述新公司的构想。
他从历史讲起。用机器学习改进机器学习并不是新想法:联合创始人Quoc Le等人早年的神经架构搜索(NAS),让模型自己设计模型,通过强化学习反馈不断产出学得更快、质量更高的架构;后续的Evolved Transformer比原版Transformer高效约30%。
而Discovery Loop要做的,是把这个思路推到尽头。Jeff的核心洞察是:科学和工程的本质,是同一个循环——提出假设、设计实验、实现、评估、把反馈送回下一轮。这个循环的每一个环节,今天都已经可以被AI有效自动化。把它们串起来,就是一台“自动做科学”的机器。
两个放大器决定了这台机器的威力:一是速度,通过构建合适的工具,让单次实验从一天、一周,压缩到一分钟、一小时;二是并行度,同时运行成千上万个实验,并用统一的基础设施评估每个实验的期望价值与算力成本,决定下一批资源投向哪里。“当实验的数量和质量同时上去,会发生一些非常了不起的事情。”
公司的路径也很清晰:先从ML研发自动化切入——这是反馈回路最短、最容易闭环的领域——再逐步扩展到硬件设计、药物发现与清洁能源。四位联合创始人(Jeff Dean、Sanjay Ghemawat、Quoc Le、Oriol Vinyals)两两之间有着14到30年不等的合作史。而公司选择注册为公益公司(PBC),Jeff的解释是:“我们会做一些不符合公司财务利益、但符合更广泛社会利益的决定,把科学发现分发给尽可能多的人。”
为什么离开?“云计算把基础设施变成了商品”
Q&A环节,有观众直接发问:你的离职让Google市值大幅波动,你在一个小公司能做到什么在Google做不到的事?
Jeff首先笑着表示,他从不把股市的单日波动归因于任何具体事件。随后他给出了真正的答案:“一个十人团队,所有人只聚焦一个使命——这种专注本身,就是在大组织里得不到的东西。我们本可以在Google内部做这件事,大概率可以。但那不一样。”
另一位观众追问了整个行业的核心矛盾:第一性原理来看,前沿AI需要海量数据、分布式系统与巨额资本开支,全是大公司的主场,为什么顶尖人才与前沿研究仍在持续流向创业公司?
Jeff的回答,或许是理解这一轮AI人才流动的一把总钥匙:
“云计算的兴起,把基础设施变成了可租用的商品。一小群人融一笔资金,就能用上大公司花几十年建好的底座,而不必自己重建。有梦想、有方向的人,第一次可以在小团队里追逐前沿。”
这场对话,不仅是一位技术领袖的个人告别与出发,更是整个AI产业变革的缩影。当基础设施走向标准化,顶尖科学家正从大厂溢出,以更聚焦的创业团队,去博取下一个数量级的科学突破。而Jeff Dean的Discovery Loop,或许正是这一趋势的最佳注脚。