李飞飞联手Yilun Du:为何机器人无需专属大脑,直接复用视频模型?
具身智能的范式转移:从“造脑”到“借脑”
在具身智能(Embodied AI)领域,长期存在一种路径依赖:认为机器人必须拥有独立的、经过海量数据训练的“大脑”——即机器人基座模型(Foundation Model)。这种思路导致行业陷入数据饥渴与算力军备竞赛,创业公司往往依靠单一基座模型撑起数十亿估值,而大厂则不惜重金构建专属模型。然而,一篇署名为李飞飞、Yilun Du等顶尖学者的论文《Masked Visual Actions for Unified World Modeling》(MVA),正在从根本上挑战这一认知。
这篇论文的核心观点极具颠覆性:机器人或许根本不需要自己的专属大模型。通过引入一种名为“像素动作”(Pixel Actions)的新接口,MVA成功打通了视频大模型与机器人控制之间的壁垒。这意味着,我们可以直接利用日趋成熟、拥有丰富物理直觉的视频生成模型,通过简单的接口对接,让机器人具备强大的操作能力。这一发现不仅解决了学术界长期存在的路线分歧,更为产业界提供了低成本、高泛化的解决方案。
视频模型的物理直觉与动作语言的断层
要理解MVA的创新,首先需厘清当前视频生成模型与机器人控制之间的核心矛盾。以Sora等为代表的视频大模型,通过观看海量互联网视频,习得了惊人的“物理直觉”。它们能预测球体滚落、水杯倾倒等物理现象,仿佛一位阅片无数的“美食评委”,深知事物发展的自然规律。
然而,这种直觉是静态的、被动的。当面对具体的机器人操作任务时,视频模型陷入了困境。机器人世界使用的是另一套语言:关节角度、末端位移、夹爪力度等精确的数值指令。这与视频模型擅长的“像素流动”语言完全脱节。
这就好比一位精通烹饪理论的评委,却被要求用摩尔斯电码来接收菜谱。视频模型虽然“懂”物理,但无法将“向左移动”这样的语义转化为具体的电机信号。过去的尝试,如UniPi依赖模糊的文本指令,Track2Act使用稀疏的点轨迹,或Ctrl-World直接输入关节角度,均存在精度不足或泛化性差的缺陷。这些方法本质上是在强迫视频模型学习一门它本不熟悉的外语,效率低下且脆弱。
MVA的核心机制:用“母语”对话的完形填空
MVA提出了一种优雅且朴素的解决方案:既然视频模型不懂机器人语言,那就用视频模型的“母语”——像素来翻译动作。其核心创新在于将动作定义为“像素遮罩轨迹”(Masked Visual Actions)。
具体而言,MVA利用Segment Anything Model (SAM) 将视频中的机器人和操作物体分割出来,形成随时间变化的色块区域。这些色块的运动轨迹,即为动作的表示。这一过程摒弃了复杂的坐标和角度,直接保留了视觉上的运动特征。
MVA的巧妙之处在于其“完形填空”式的训练机制。它将物体运动轨迹和机器人运动轨迹分别遮蔽,让模型进行双向推理:
- 正向模拟(世界模型):遮蔽物体轨迹,仅保留机器人动作。模型根据机械臂的运动,推演物体接下来如何移动。这相当于让模型扮演“世界模拟器”。
- 逆向生成(动作规划):遮蔽机器人轨迹,仅保留物体变化。模型根据物体的预期移动,反推机械臂应如何运动。这相当于让模型扮演“动作生成器”。
关键在于,这两项任务由同一个模型、同一套参数完成,无需切换开关。这种设计不仅简化了架构,更让模型在模拟与规划之间建立了深层的语义关联。
低成本微调与零样本泛化的奇迹
MVA的另一大亮点在于其极低的训练成本。它并未从零训练基座模型,而是基于阿里开源的视频生成模型Wan2.2(140亿参数)进行微调。通过LoRA技术,仅使用15小时的机器人操作数据,MVA便赋予了Wan2.2理解像素动作的能力。
这种“站在巨人肩膀上”的策略避免了全面重训带来的“灾难性遗忘”风险,即防止模型丢失原有的物理直觉。实验数据显示,MVA在LPIPS指标上以0.0945的成绩大幅领先对比方法(0.362),且在从单臂机器人到未见过的双臂机器人的跨本体测试中,依然保持了稳定的泛化能力。相比之下,传统方法在更换机器人本体后往往立即失效。
产业视角:URDF与运动学解算的关键作用
从产业界视角来看,MVA的价值不仅在于模型性能,更在于其解决了“跨本体迁移”这一长期痛点。韦特嘉机器人CTO李琳鑫指出,MVA的核心突破在于引入了URDF(统一机器人描述格式)和逆运动学(IK)解算。
传统VLA(Vision-Language-Action)模型直接输出与特定本体绑定的关节角度,导致换机即失效。而MVA采用间接输出策略:先通过视频模型理解环境并生成通用的像素动作,再结合具体机器人的URDF文件,利用逆运动学解算出各关节的具体角度。
这一层“中转”具有双重意义:
- 泛化性增强:指令通用化,执行方式适配化。无论机械臂结构如何变化,只要提供URDF,模型即可适配。
- 物理约束限制:URDF提供的运动学限制,遏制了视频模型天马行空的想象力,确保生成的动作在物理上是可执行的,提高了画面的可信度。
行业趋势:视觉与动作的解耦与融合
MVA的出现,恰逢具身智能行业从“端到端”向“分层架构”演进的趋势。当前,业界越来越倾向于将“看”(视觉感知)与“动”(动作控制)解耦。视觉部分利用互联网海量视频数据训练,获取丰富的世界知识;动作部分则通过相对少量的机器人数据结合运动学计算补齐。
MVA正好卡在这一趋势的接口上。它证明了,通过像素动作接口,可以将视频大模型的视觉能力直接转化为机器人的操作能力。这种思路与Yann LeCun提出的隐空间世界模型路线在底层逻辑上殊途同归:都依赖于对物理世界的深刻理解,并通过运动学约束实现精准控制。
结语:蝴蝶效应与未来展望
MVA论文所引发的“蝴蝶效应”正在显现。它提示我们,具身智能的未来不在于构建越来越大的机器人专属模型,而在于如何高效地复用已有的视觉大模型。互联网视频数据的无限性与机器人实机数据的稀缺性之间的巨大鸿沟,正通过这种“翻译接口”被逐步填平。
当学术界的顶尖力量与产业界的实际需求不约而同地指向同一方向时,我们看到的不仅是一项技术的突破,更是一种新范式的诞生。机器人不再需要从头学习如何“思考”,而是学会了如何“表达”。这种从“造脑”到“借脑”的转变,或许正是具身智能走向大规模量产的关键钥匙。随着更多类似工作的涌现,我们可以预见,一个低成本、高泛化、快速部署的具身智能新时代正在到来。