世界模型到底是什么?从视频生成到机器人行动的能力路线图

1 阅读

“世界模型”这个词,现在谁都能用

2026 年,“世界模型”成了 AI 圈最没有共识的术语之一。

图片

有人把一段能连续生成的视频叫世界模型;有人把一个随鼠标点击实时变化的虚拟环境也叫世界模型;还有人把在潜空间里预测未来状态的系统,或者直接输出机器人动作的策略,统统归入这个名下。

图片

它们确实都在处理“世界”的信息,但能力边界天差地别。一段视频可以逼真到以假乱真,却可能让水往高处流、玻璃碎成方块;一个机器人能精准抓取杯子,也可能只认得实验室里那一只、那个角度、那条轨迹。仅看演示,很难判断一个系统到底学到了视觉相关性、物理结构,还是行动与结果之间的因果关系。

图片

这种概念混乱,直接增加了技术判断的难度。画质、几何精度、预测准确率和任务成功率被混在一起比较,不同团队看似在同一条赛道上竞速,实际回答的可能是完全不同的问题。

图片

于是,世界模型的研究开始回到一个更基本的问题:一个系统究竟需要具备哪些能力,才能从“生成内容”走向“理解并改变世界”?

图片

三种视角:渲染器、模拟器,还是规划器?

图片

面对混乱,不同团队尝试给出自己的分类。

图片

李飞飞和她创立的 World Labs 把世界模型按功能拆成三类:渲染器(输出像素)、模拟器(输出世界状态)和规划器(输出动作)。这种划分强调输出形式的差异。

图片

Yann LeCun 则主张,模型应在抽象的潜空间中学习可预测的世界结构,保留对理解、推理和规划真正有用的信息,而不是沉迷于像素细节。

文章配图

清华大学朱军团队提供了第三个角度。早在 2024 年 12 月发布 Motus 时,他就公开阐述了“通用世界模型”的整体构想。今年 3 月,他进一步将其定位为连接数字世界与物理世界的基础。几个月后,团队在论文《General World Models from First-Principles》中,从第一性原理出发,定义了核心能力,并给出了一张清晰的五级进化路线图

图片

通用世界模型的三项核心能力

论文将通用世界模型的能力归纳为三个词:理解、想象、行动

这听起来很抽象,但其实源于最朴素的经验。想想学骑自行车的过程:一开始身体摇晃,看到车把偏了、感觉重心下沉,人会立刻调整方向,再根据新的反馈继续修正。练得多了,大脑就能预判某个动作会带来什么结果。

1943 年,心理学家 Kenneth Craik 就提出,人类会在头脑中构建现实的“小尺度模型”,用来推演不同行动的后果。后来强化学习中的 POMDP 框架,也描述了类似过程:智能体接收局部观测,估计世界状态,采取动作,再用新观测更新判断。

朱军团队将这一逻辑提炼为通用世界模型的三项核心能力,它们构成一个持续更新的闭环:

  • 理解(Understanding):整合视觉、语言、声音、触觉或机器人传感器等信息,形成对当前世界的内部判断;
  • 想象(Imagination):从当前状态推演多个可能未来,尤其是“如果我做 A 而不是 B,结果会怎样”这类反事实预测;
  • 行动(Action):将预测转化为对数字或物理环境的实际干预,并让行动后的新观察反过来检验和修正模型。

这个闭环解释了为什么视频生成不等于世界模型的全部。视频模型能回答“接下来画面可能是什么”,但要走向通用,它必须能回答“如果我移动这个物体、施加这个力,世界会如何不同?”——这类带有行动条件的预测,才真正触及因果、反事实和可执行决策。

五级路线图:从生成到组织

为了描述世界模型如何演进,团队提出了五级能力路线:

  • L1:生成世界 —— 能生成连贯的时空序列,如视频;
  • L2:交互世界 —— 能响应外部输入(如用户操作),持续演化世界状态;
  • L3:在世界中行动 —— 能输出可执行的动作,改变物理或数字环境;
  • L4:自主世界智能体 —— 能主动探索、设定子目标、从失败中学习;
  • L5:世界组织者 —— 能协调多个智能体,在开放环境中组织复杂协作。

用一个具体例子来理解:一只玻璃杯被推到桌边。

  • L1 模型能生成它滑落、撞击、碎裂的画面;
  • L2 模型能在你改变推动方向或视角后,继续合理演化;
  • L3 模型则要判断杯子是否会掉、预测伸手是否来得及,并输出机器人真正能执行的抓取动作;
  • L4 不等人下令,它自己发现风险、主动观察、补充信息,失败后还能调整策略;
  • L5 则要考虑多人协作:谁去抓杯子?谁避障?谁调配工具?环境变了怎么重排任务?

这条路线的意义在于,它把“世界模型”从一个模糊名词,变成了一组可逐级检验的问题

  • L1 看生成是否连贯;
  • L2 看世界能否持续响应;
  • L3 看模型能否改变物理环境;
  • L4 看系统能否主动探索和持续学习;
  • L5 看它能否组织开放环境中的多主体协作。

据论文判断,现有系统已触及 L1–L3,L4 和 L5 仍是开放问题。主要缺口包括:因果与物理接地、持久记忆、在线学习、高效部署和安全控制。评测标准也要转向:比较预测与真实结果,考察模型在陌生任务、环境和本体上的迁移能力。

数据金字塔:从视频到具身

世界模型的难点,不仅在算法,也在数据。

互联网视频规模巨大,记录了丰富的物体、场景和运动,模型可从中学习空间结构、物体持续性和事件发展规律。但视频很少同步记录造成变化的动作、力量和意图

机器人轨迹能连接观测、动作和结果,但采集成本高,且容易绑定特定硬件和任务。

朱军团队提出的解决方案,是一座数据金字塔

  • 底层是海量互联网视频,提供世界知识和动态先验;
  • 向上依次是领域视频、第一视角人类视频、带动作记录的人类示范;
  • 顶层是真实机器人交互数据。

越往上,数据越稀缺、成本越高,但动作、任务与机器人本体的对应关系也越清晰。

这也解释了为什么生数科技同时推进视频生成具身智能:视频提供广度,机器人数据完成行动接地。

在数字侧,Vidu 系列探索视觉世界的生成与交互。Vidu S1 更将一次性生成推进到实时响应,让用户输入能持续改变后续内容,测试模型能否在交互中保持状态连续。

在物理侧,Motus 与 Motubrain 将环境理解、状态预测与机器人动作接入同一条链路:看清环境 → 预测干预后果 → 输出可执行动作 → 接受真实结果检验。

两条产品线,是对同一个世界模型假设的两次验证:数字环境检验“能否理解并想象”,物理环境检验“这些知识能否支持行动并在反馈中修正”。

MoT 架构:统一计算,分模态协同

要让两类验证共享底层能力,图像、视频、语言和机器人动作需围绕同一个世界状态协同计算。

传统模块化系统逐级传递信息,容易在接口处损失几何、时间和不确定性信息。而所有模态完全共享参数,又可能导致训练冲突——海量视频数据压制稀缺的机器人信号。

团队提出的 MoT(Mixture-of-Transformers)架构,试图在两者间取得平衡:不同模态保留各自的专家参数,再通过共享注意力机制交换上下文。

  • 视觉告诉模型“环境中发生了什么”;
  • 语言提供“目标和约束”;
  • 动作代表“对环境的干预”;

三类信息共同更新模型对世界的判断。MoT 提供了统一计算基础,但物理规律、跨本体迁移、实时推理和安全控制,仍需靠数据、训练与系统工程解决。其目标很明确:构建一个能被不同模态共同读写、持续更新的世界状态

Motus2:动手前,先在自己的世界里试一遍

如果说 Motus 与 Motubrain 将探索推进到 L3,那么近期提出的 Motus2 则尝试向 L4 延伸,加入结果评估与策略反馈,让行动闭环具备自我改进能力。

Motus2 没有把动作生成、未来模拟和结果评估做成三套独立系统,而是以一套共享参数的视频—动作模型,暴露出三种控制接口:

  • 策略(Policy):提出可执行的候选动作;
  • 模拟器(Simulator):预测这些动作在视觉世界中可能造成的后果;
  • 评估器(Evaluator):判断哪种结果更接近任务目标,并用于选择和改进。

这就像一次真正的“先心灵,再手巧”。机器人不再看到物体就直接输出动作,而是先提出几种方案,在模型中预演各自带来的画面与任务进度,再选择更好的那一步。执行后的成功、失败或不理想结果,也不再是数据废料,而成为下一轮动力学建模与价值学习的证据。

动作、预测、评估、反馈和再行动,由此进入同一个决策与学习回路——这也是 Motus2 强调的闭环自进化

在数据侧,Motus2 采用分层训练路径:从单目第一视角视频,扩展到同步双目数据,再通过机器人数据完成本体适配。训练使用约 13 万小时人类第一视角记录,以及超过 100 小时的机器人轨迹和人机对齐数据。路径逻辑是:先积累人类与世界互动的共同经验,再学习如何用机器人身体把理解变成动作

在执行侧,Motus2 还引入独立的轻量触觉专家,对即将执行的短动作进行细化,并预测接触后的力反馈。视觉擅长看清物体位置和宏观变化,触觉则补上“最后一厘米”的细腻操作——压、碰、抓、旋——让模型在“看得见”之外,多一层即时校正。

目前,Motus2 仍处于从 L3 向 L4 延伸的阶段。验证集中在特定机器人和操作任务,自主目标形成、持久记忆、开放环境泛化、长期在线学习与安全控制仍有待探索。但它的主要进展,是将策略、模拟、评估和触觉反馈整合进同一套系统,为走向 L4 自主世界智能体提供了一条可检验的路径

一条中国技术路径:从概率学习到世界智能

通用世界模型的框架,延续了朱军及清华 TSAIL 实验室长期的研究脉络。

朱军教授长期深耕贝叶斯方法、概率机器学习、生成模型与强化学习——分别处理不确定性、数据分布、未来生成和行动决策。TSAIL 也培养了一批进入全球前沿的研究者,如宋飏(得分生成模型)、宋佳铭(DDIM)等。

从概率建模到生成与决策,这条学术路径映照出 AGI 发展的两类入口

  • 一类从语言出发,逐步增强推理、工具调用和任务执行能力;
  • 另一类从视觉与动态世界出发,走向实时交互和具身行动。

在中国 AGI 产业版图中,智谱与生数可视为这两条路径的代表。智谱从语言模型出发,持续增强推理、Coding 和 Agent 能力;生数则从视频生成出发,进入实时交互、具身行动与策略优化。

两条路线正在相互渗透。语言 Agent 需要视觉反馈和环境模型,世界模型也需要语言来表达目标、规则与计划。不同入口最终都指向对语言、世界状态和行动的共同建模

竞争的终点,是经受反馈的能力

世界模型的竞争,终将从 Demo 的震撼程度,转向系统经受反馈的能力

画面能制造可信的第一印象,几何和物理决定这个世界能否被反复使用,而行动则把模型的判断带进现实。一次预测是否成立,要等干预发生后才能确认;一次任务是否成功,也要放到陌生场景、长期运行和持续变化中检验。

朱军团队的论文没有为世界模型之争写下最终答案,但它提供了一组可以继续检验的问题:模型理解了什么?能够想象多远?行动之后,能否修正自己?

过去十年,AI 最重要的进展来自学习语言和数据中的统计规律。下一阶段,模型还要面对一个持续变化、可被干预、且会给出真实反馈的环境。当模型能在这样的环境中不断形成判断、承担行动后果并持续学习,世界模型才会从一个拥挤的技术名词,逐渐成为通向通用智能的坚实基础。