李飞飞联手Yilun Du:为何机器人无需专属大脑,直接复用视频模型?

0 阅读

具身智能的范式转移:从“造脑”到“借脑”

在具身智能(Embodied AI)的演进历程中,行业长期陷入一种路径依赖:认为机器人必须拥有专属的、经过海量数据训练的“大脑”基座模型,才能理解物理世界并执行复杂任务。然而,近期一篇由李飞飞、Yilun Du等顶尖学者联合署名的论文,正在从根本上挑战这一认知。

这篇题为《Masked Visual Actions for Unified World Modeling》的工作,提出了一种极具颠覆性的观点:机器人或许根本不需要构建专属的大模型,而是可以通过一种新的接口,直接“借用”日益成熟的视频生成模型的物理直觉。这种思路不仅降低了技术门槛,更可能彻底解决机器人跨本体泛化的行业痛点。

视频模型的物理直觉与动作执行的断层

当前的视频生成大模型,如Sora或Wan2.2,已经展现出了惊人的物理世界模拟能力。它们通过观看海量视频,习得了物体运动、重力作用、碰撞反馈等物理规律。这种能力类似于人类通过观察自然形成的“物理直觉”。

然而,这种直觉存在明显的断层。视频模型擅长预测“接下来画面会如何变化”,却不懂“如何发出指令让画面按预期变化”。对于机器人而言,传统的控制指令是关节角度、末端位移等抽象数字。这些数字与视频模型理解的像素流动语言完全脱节。

这就好比一位精通美食的评委,却只能接受摩尔斯电码作为输入。他深知菜肴的精髓,却无法通过电码理解具体的烹饪步骤。过去,研究者试图通过文字描述或稀疏轨迹点来弥合这一差距,但文字过于模糊,轨迹点缺乏连续性,而直接输入关节角度又导致模型极度脆弱,一旦更换机械臂结构,原有模型便失效。

MVA的核心机制:像素遮罩作为通用语言

Masked Visual Actions (MVA) 提出了一种优雅的解决方案:将动作转化为视频模型最熟悉的“像素遮罩轨迹”。

这一过程分为三个关键步骤:

首先,利用Segment Anything Model (SAM) 等工具,从视频中分割出机器人和操作物体的轮廓,形成随时间变化的色块轨迹。这些色块记录了机器人和物体在空间中的运动路径,摒弃了复杂的关节数据,仅保留视觉层面的运动信息。

其次,引入“完形填空”式的训练机制。通过遮蔽物体或机器人的运动轨迹,让模型进行双向推理。当遮蔽物体轨迹时,模型根据机器人动作预测物体变化,扮演“世界模拟器”角色;当遮蔽机器人轨迹时,模型根据物体变化反推机器人动作,扮演“动作生成器”角色。

最后,无需从零训练。MVA基于现有的开源视频生成模型(如Wan2.2),仅通过LoRA技术进行轻量级微调。这种策略保留了预训练模型强大的物理直觉,同时赋予了其理解机器人动作语言的能力。

数据效率与泛化能力的双重突破

MVA的价值不仅在于理论创新,更在于其卓越的数据效率和泛化能力。

在数据效率方面,传统方法往往需要数百万小时的机器人操作数据进行训练,成本高昂。而MVA仅需15小时的真实机器人数据微调,即可实现从单臂到未见过的双臂机器人的Zero-shot(零样本)泛化。这意味着,模型在训练阶段从未见过双臂机器人,但在测试阶段却能准确预测其运动轨迹。

在泛化能力方面,MVA通过引入URDF(Unified Robot Description Format,统一机器人描述格式)文件,实现了动作指令与执行机构的解耦。URDF记录了机械臂的运动学参数,如关节数量、连杆长度等。MVA先通过视频模型预测末端目标位置,再结合URDF文件,利用逆运动学(IK)算法计算出具体关节的角度。

这种“先规划后执行”的两层架构,使得模型生成的动作必须符合机械臂的物理约束,避免了视频模型可能产生的“幻觉”姿势。同时,由于指令是通用的空间目标,而非特定的关节角度,因此可以轻松迁移到不同结构的机械臂上。

产业视角:解决跨本体迁移的终极痛点

从产业界的角度来看,MVA的意义在于解决了长期困扰机器人的“跨本体迁移”难题。

深圳韦特嘉机器人CTO李琳鑫指出,大多数面向实机部署的视觉-语言-动作(VLA)模型,输出的是与特定本体绑定的低层动作表征。换一台运动学结构不同的机器,这套输出即刻失效。而MVA通过引入URDF和运动学解算,增加了一层中转,极大地增强了泛化性。

这一思路与当前行业趋势不谋而合。具身智能正在走向“看”与“动”的解耦。视觉部分利用互联网海量视频数据训练,获取丰富的物理常识;动作部分则利用少量机器人数据结合运动学计算补齐。MVA正好卡在这个趋势的接口上,为产业界提供了一条低成本、高泛化的技术路径。

学术共识与技术融合的信号

李飞飞与Yilun Du的罕见联手,也释放了重要的学术信号。两人分别代表了具身智能领域的两条主要路线:李飞飞主张让AI直接在像素空间中思考,而Yilun Du倾向于将世界压缩为抽象数字进行推理。

此次合作表明,两条路线并非截然对立,而是可以在特定接口上达成融合。MVA通过像素遮罩这一中间表示,既保留了视觉模型的直观性,又实现了动作生成的精确性。这种融合可能预示着具身智能未来将不再拘泥于单一的技术路线,而是走向更加开放和兼容的架构。

结语:重新定义机器人智能的边界

MVA论文提出的“偷用”视频模型思路,并非简单的技术拼接,而是对机器人智能本质的一次重新思考。它暗示着,未来的机器人智能可能不再依赖于构建封闭的、专属的大模型,而是通过开放的接口,实时调用外部强大的视觉和物理模型。

这种范式转移将极大地降低具身智能的开发门槛,加速机器人技术的普及。当机器人能够像人类一样,通过观察和理解视频来学习动作时,其智能水平将得到质的飞跃。对于产业界而言,这意味着更低的研发成本、更快的部署速度以及更强的适应能力。

随着更多顶尖学者的加入和技术的不断迭代,基于视频模型的具身智能解决方案有望成为主流。这不仅是一场技术的革新,更是一次对机器人智能边界的重新定义。未来,机器人或许真的不需要一个专属的大脑,只需要一双能看懂世界的眼睛,和一套能将其转化为行动的通用语言。