李飞飞发布R2S2R引擎:机器人仿真训练如何实现真实闭环?

0 阅读

在具身智能(Embodied AI)迈向规模化落地的关键节点,数据获取与策略评估的瓶颈日益凸显。李飞飞领衔的World Labs近期通过收购机器人仿真公司SceniX,正式推出了Real-to-sim-to-real (R2S2R) 引擎。这一举措不仅标志着其空间智能版图从“生成可交互虚拟世界”向“训练与部署真实机器人”延伸,更首次打通了从仿真训练到真实运行的完整闭环。

R2S2R的核心价值在于构建了一个可闭环迭代的机器人学习生态系统。该引擎由Real-to-Sim(现实到仿真)和Sim-to-Real(仿真到现实)两个关键环节组成。Real-to-Sim负责将现实中的机器人本体、传感器配置、物体属性及交互过程高精度重建为虚拟环境;而Sim-to-Real则利用这一高保真环境进行策略训练与评估,并将优化后的策略直接部署至真实硬件。这种机制使得机器人策略的评估得以规模化,同时也极大降低了现实实验的成本与风险。

突破具身智能的“数据荒”与“评估难”

当前机器人领域面临的主要挑战并非模型架构本身,而是缺乏能够规模化获取的经验数据与高效的评估体系。在真实物理世界中,物体的位置、光照条件、物理属性以及交互过程的微小变化,都会对机器人的表现产生巨大影响。要使机器人真正走出实验室,进入复杂多变的家庭或工业场景,必须提前覆盖海量的场景变体,并反复测试其在极端或失败条件下的鲁棒性。

与互联网上易于获取的大规模文本或图像数据不同,机器人的每一条有效经验都需要真实的物理交互。每轮实验都意味着硬件的占用、人工的介入以及系统的重置维护。即便拥有海量的人类演示视频,也难以系统性地覆盖不同的环境参数、物体物理属性及失败触发条件。因此,仿真技术的核心价值超越了单纯的数据采集成本节约,更在于其能够主动制造现实中昂贵、危险或难以复现的场景,让机器人在虚拟环境中反复经历成功与失败,从而加速学习进程。

然而,传统仿真技术存在显著短板。以往为特定任务搭建仿真环境成本高、周期长,且仿真与现实之间存在视觉、几何及物理动态上的“Reality Gap”。更关键的是,机器人在仿真中学会的策略往往难以直接迁移至真实世界,仿真中的高成功率未必能转化为真机上的有效表现。R2S2R的提出,正是为了弥合这一鸿沟。

Real-to-Sim:从数据到高保真虚拟环境的转化

R2S2R的第一步是Real-to-Sim,即如何将现实任务转化为可交互的虚拟世界。团队首先采集机器人本体、传感器参数、环境几何、物体属性及任务演示等多模态信息,随后利用生成式世界建模系统(如Marble)将其重建为与真实任务对齐的虚拟环境。

这一过程的难点在于真实环境的参数往往不完全可知。例如,物体的重量、摩擦系数难以精确测量,机器人本体与摄像头的实际参数可能与标称值存在偏差,而电缆、包装材料等柔性物体的形变更是难以用传统简单物理模型描述。为此,R2S2R采用了灵活建模策略,根据任务需求组合使用不同的表示方法与物理引擎。

在重建完成后,系统通过让机器人在现实与仿真中执行相同的动作序列,直接对比视觉观测、物体运动轨迹及最终任务结果,以验证仿真与现实的高度一致性。以双机械臂装箱任务为例,仿真环境与现实环境在相同动作输入下,能够产生高度一致的观察结果与物体反馈,证明了其在视觉与动力学层面的对齐能力。

Sim-to-Real:规模化训练与策略迁移

当仿真世界与现实实现高保真对齐后,便进入了Sim-to-Real阶段。此时,仿真环境不再仅仅是现实的投影,而转变为可扩展的策略训练与评估引擎。

在这一阶段,机器人在仿真中学习新策略,评估系统主动搜索策略容易失败的状态边界,并围绕这些薄弱环节生成新的交互经验,形成“发现问题—补充数据—改进策略”的闭环迭代机制。相比现实数据采集,仿真允许系统性地调整物体位置、机器人初始状态、视角、外观及物理参数,使策略能够反复经历现实中难以复现的高难度或高风险场景。

更为重要的是,仿真环境能够提供硬件上难以直接采集的监督信号,如精确的物体内部状态、接触力分布等,这些数据对于优化底层控制策略至关重要。一旦完成训练,经过验证的策略可直接部署至真实硬件。报告显示,仅基于仿真数据训练的策略,已成功迁移至ALOHA、RB-Y1、YAM、Flexiv及xArm等多种不同构型的机器人平台,并完成了装箱、绕线、试管转移及杂乱环境抓取等复杂任务。

高通量评估:从“试错”到“预测”

R2S2R的另一大突破在于其评估能力的革新。传统机器人开发中,测试一个新的策略Checkpoint往往需要重新布置场景、运行真机并处理潜在失败,成本高昂且覆盖率极低。R2S2R则允许在数千种受控条件下主动寻找失败案例,提前筛选出表现优异的Checkpoint,仅将最有希望的策略留给真机验证。

关键在于,评估的一致性并非要求仿真与现实的成功率数值完全相同,而是要保持相对排名的一致性。即:在仿真中表现优于其他策略的Checkpoint,在真机上通常也应表现更优;仿真中观察到的成功与失败分布,应能真实反映真机的性能特征。

在ALOHA双臂方块交接任务的实验中,团队对比了GR00T N1.6与π₀.₅两种策略架构及多种训练配置。结果显示,仿真测试的2000次结果与真机测试的100次结果呈现出高度一致的相对排名。即使是在线缆缠绕、关节物体等极难模拟的场景中,仿真也成功复现了真机上“险些失手”的边缘案例。这表明,R2S2R不仅能够预测最终结果,更能还原导致成功或失败的过程逻辑,从而成为机器人开发中的高通量评估层。

收购SceniX:构建解耦的机器人基础架构

此次R2S2R的发布并非孤立事件,而是World Labs战略整合的重要一步。就在引擎发布前夕,World Labs宣布收购SceniX。SceniX由哥伦比亚大学助理教授、李昀烛博士创立,其技术专长聚焦于将真实机器人任务数字化,实现规模化仿真训练与评估。

World Labs擅长生成模型、计算机视觉与3D重建,能够从稀疏输入中快速生成具备空间一致性的世界;而SceniX则深耕机器人学、仿真算法及硬件系统,懂得如何让机器人进入这些世界中进行有效学习。两者的结合,完美互补了“世界如何生成”与“机器人如何学习”两大环节。

李昀烛在访谈中强调,收购并非为了World Labs亲自制造机器人硬件,而是旨在构建一套与机器人形态和解耦的基础设施。无论客户使用的是单臂、双臂、移动机器人,还是基于VLA或World Action Model的算法架构,均可接入同一套数字世界进行训练与测试。

展望未来:从半结构化场景到通用智能

R2S2R的推出,预示着机器人开发范式正在从“定制化仿真”向“通用化仿真基础设施”转变。未来,World Labs与SceniX将继续整合仿真技术、基础模型及动作条件模型,优先在仓库物流、实验室操作及电子装配等半结构化场景中开展真实部署验证。

随着技术成熟度提升,这一闭环体系有望降低具身智能的研发门槛,加速机器人从实验室走向千家万户。通过持续迭代Real-to-Sim的高保真度与Sim-to-Real的迁移能力,数字世界将成为机器人汲取经验、测试边界、优化策略的核心源泉。这不仅是对世界模型三分法(渲染器、仿真器、规划器)中“仿真器”角色的有力补全,更为实现具备高度自主性与鲁棒性的通用机器人奠定了坚实基础。

在AI重塑实体世界的进程中,R2S2R提供了一条兼顾效率与可靠性的技术路径。它证明,通过构建与现实高度对齐的数字孪生环境,我们可以以更低的成本、更高的频率探索机器智能的边界,最终实现从虚拟仿真到真实应用的无缝衔接。这一进展不仅属于World Labs,也为整个具身智能行业提供了一个可复用的解决方案范本,推动着机器人技术向更广泛、更复杂的应用场景迈进。