世界模型定义之争:为何“动作条件”是具身智能的核心门槛?
具身智能的“大脑”困境:从行为模仿到机理理解
2026年上半年,中国人工智能领域出现了一个显著的资金与人才流向:世界模型。仅前六个月,国内该赛道披露融资总额约300亿元,若将具身智能融合赛道纳入,这一数字更是膨胀至900多亿元,融资增速超过去年同期五倍。然而,在百亿资金与海量人才如潮水般涌入的同时,行业内部却弥漫着一种深层的焦虑:究竟有多少人真正厘清了“世界模型”的本质?
具身智能(Embodied AI)的爆发,让机器人从实验室演示走向真实应用成为可能。宇树科技的机器人在马拉松赛道上奔跑,智元机器人的翻跟头表演,展示了本体运动控制的惊人进步。但从业者普遍观察到,落地应用仍差“一口气”。这种差距并非源于硬件本体的成本或可靠性,中国供应链在电机、传动机构等关键部件上的迭代已极为扎实,甚至走出了仿真强化学习迁移到真实机器人的扎实路径。
真正的瓶颈在于“大脑”。当前深度学习更多是在学习智能的“行为表象”,而非“智能机理”。具身智能需要的是对物理世界的因果推断能力——即理解“因为A所以B”的逻辑链条,而不仅仅是统计关联。目前的机器人虽然具备了动物的基础本能反应,但在面对复杂环境时的常识理解、自适应能力以及深层因果推理上,仍处于起步阶段。这种深层次能力的缺失,导致机器人在单一场景下成功率虽可达80%,但在横向延展场景中泛化能力不足,无法摆脱人力兜底,难以实现真正的终端级独立部署。
世界模型的复兴:从游戏验证到物理世界
“世界模型”并非新概念,早在20世纪90年代就有学者尝试对智能体交互所需的环境进行建模。然而,由于当时深度学习尚未兴起,这一概念长期沉寂。直到2018-2019年,随着强化学习在游戏场景中的成功应用,世界模型的概念才得到初步验证。研究者开始探索让AI智能体在与环境交互中自主“学出”一个世界模型,将环境演化过程封装进模型中。
如今,世界模型之所以成为风口,核心驱动力来自具身智能对高效训练环境的迫切需求。早期的视觉-语言-动作模型(VLA)沿用了大语言模型的模仿学习范式,即通过预测下一个动作来指导机器人。然而,模仿学习存在致命瓶颈:它只能让机器人“学会开口说话”,却无法保证“说对”。在具身智能中,强化学习是提升智能程度和动作成功率的关键,但其在真实物理世界中面临两大障碍:数据收集效率极低,以及失败成本不可承受。例如,机器人学习洗碗,若通过真实试错,可能需打碎成千上万个碗;自动驾驶学习避障,可能需经历大量真实事故。
世界模型提供的虚拟环境,正是解决这一痛点的出口。它允许机器人在虚拟空间中通过“脑补”进行无数次试错,推演动作后果,从而将最优方案迁移至真实世界。这种低成本、高安全的训练范式,使得世界模型成为具身智能突破数据与成本瓶颈的关键基础设施。
定义之争:为何“动作条件”是核心门槛?
尽管世界模型热度高涨,但行业对其定义众说纷纭。视频生成模型(如Sora)、3D空间建模、以及LeCun提出的JEPA架构,均被部分人冠以“世界模型”之名。然而,这种泛化定义模糊了技术边界,阻碍了产业聚焦。
IEEE Fellow、视启未来创始人张磊提出了一个严谨且可操作的定义:世界模型必须是“Action Conditioned”的,即以动作为输入条件。他认为,智能体与环境交互的核心闭环在于:动作导致环境变化,环境变化产生新状态并反馈给智能体。因此,世界模型的本质应是“Action Conditioned的Next State Prediction”,即预测“如果执行某个动作,环境会变成什么样”。
这一标准将纯视频生成模型排除在外。Sora等模型虽然能生成自洽的视频序列,预测像素变化,但并未建模“动作”这一关键维度。它们无法回答“如果我做这个动作,世界会如何变化”,因此无法直接服务于强化学习中的决策优化。同样,近期出现的World Action Model(WAM)虽涉及动作预测,但其逻辑是“先果后因”,即先生成未来画面再反推动作,这种逆向建模方式同样不符合强化学习对正向因果推演的需求。
只有具备动作依赖性的模型,才能真正帮助智能体在虚拟环境中进行有效的策略搜索与优化,从而解决具身智能中的泛化与成功率问题。
路线辨析:像素派与隐空间派的殊途同归
在世界模型的技术路线上,行业存在“像素派”与“隐空间派”之争。以Sora为代表的像素派追求像素级的逼真生成,而以LeCun为代表的隐空间派则主张在抽象表征空间中进行预测。
张磊指出,这两条路线在本质上是相通的。像素派模型(如Stable Diffusion、Sora)在处理图像或视频时,同样需要先将数据压缩到低维表征空间。因此,真正的分歧不在于是否使用隐空间,而在于进入隐空间后保留什么、丢弃什么。
隐空间派的优势在于排除光影、纹理等非物理规律驱动的像素细节,有助于模型学习状态变化背后的本质规律。但其面临“表征坍塌”的风险,即不同状态映射为相同表示,导致模型丧失辨别能力。像素派则追求纤毫毕现,虽符合人类视觉直觉,但往往陷入“讨好眼睛”的陷阱,生成的视频可能出现违背物理常识的Bug(如物体穿模、悬浮)。
张磊强调,人脑在进行反事实推理时,也是在隐空间中进行操作,而非逐像素渲染。因此,世界模型的评价标准不应是像素逼真度,而是物理合理性。隐空间路线若能解决表征坍塌问题,并引入必要的结构信息,将更具优势。
创新突破:引入“物体结构”的隐空间世界模型
在隐空间路线上,张磊团队提出了关键创新:引入“物体结构”。LeCun的JEPA架构验证了预测发生在表征空间的公理,但在具身智能的高复杂度物理空间中,仅靠抽象表征难以应对大规模真实环境的挑战。
视启未来团队基于其在DINO-X等开放世界物体感知模型上的积累,提出让“物体”成为世界模型预测与规划的基本单元。物理规律是作用在物体上的,让隐空间表征理解物体及其相互关系,能更有效地学习物理规律。这一方法既避免了像素派的视觉穿帮,又比纯抽象隐空间更适合机器人在真实世界中的避障、抓取与动作规划。
通过反事实测试,可以验证模型是否真正理解了物体结构。如果模型在轨迹微调后仍能做出物理合理的预测,说明其学到了规律;若仅依赖统计相关性,则会在细微变化中失效。这种简洁的范式迭代,避免了过多人为设计对长期发展的阻碍。
数据基石:EgoTwin与动作对齐
世界模型的效能高度依赖数据质量。张磊团队提出的EgoTwin解决方案,旨在解决“动作对齐”这一核心难题。具身智能的输入包括画面(状态)和动作,而不同本体(人手、机械臂、灵巧手)的动作空间差异巨大。
人手数据通常为2D视频,缺乏三维坐标信息,而机械臂数据则具有精确的XYZ坐标。直接混用会导致效率低下。EgoTwin通过提取3D关键点,将人手的2D视频转化为3D空间的操作序列,实现不同本体动作在统一物理空间中的对齐。这一技术不仅解决了数据采集的效率问题,还通过算法与数据并行迭代,确保了数据的高利用率。
此外,张磊强调,数据原料的质量至关重要。行业在数据采集上投入巨大,但利用效率往往不理想。只有深入理解算法需求的数据采集,才能转化为训练世界模型的有效养分。
结语:理解透,是科研的底色
从20世纪90年代的AGV小车调试,到2026年的世界模型研究,张磊的科研生涯始终围绕“让AI理解物体”这一命题。他的导师张钹院士曾教导他:“理解不透就会被骗,理解透了才知道底层原理是怎么回事。”这种对底层机理的执着追求,构成了中国科研人代代相传的精神底色。
世界模型不仅是技术路线的选择,更是对智能本质的探索。在像素与隐空间、模仿与强化、数据与算法的博弈中,唯有坚持“动作条件”这一核心门槛,引入物体结构,解决数据对齐难题,具身智能才能真正跨越从实验室到真实应用的鸿沟。浪潮虽汹涌,但唯有那些深刻理解物理规律、坚持第一性原理的团队,才能在未来的竞争中脱颖而出。