宇树科技开源具身多模态模型 UnifoLM-WLA-1.0,统一视觉语言与动作控制
模型定位:一个能“看懂—想清—动手”的端到端系统
宇树科技最近开源了 UnifoLM-WLA-1.0,这是一个60亿参数的具身多模态大模型。它不像传统机器人系统那样把感知、规划、控制拆成几个独立模块,而是用一个模型直接把图像、自然语言指令和机器人动作串在一起处理。简单说,你告诉机器人“把桌上的红色杯子放到左边架子上”,它就能自己看图、理解空间关系、生成动作序列,然后执行。
这个模型最特别的地方在于,它不是靠仿真数据“纸上谈兵”,而是用大约2500小时的真实机器人操作数据训练出来的。这意味着它的动作输出更贴近真实机器人的物理限制和动力学特性,而不是在虚拟世界里“飘着走”。
目前,宇树已经开放了两个核心组件的权重:约40亿参数的 UnifoLM-ER-1(负责感知与推理)和 ER-Flow(负责动作建模)。完整的6B系统代码和后训练流程会陆续放出。所有内容都以 Apache 2.0 协议开源,允许本地部署和商业使用。

核心能力:从“看到”到“做到”的闭环
UnifoLM-WLA-1.0 能完成64项具体任务,其中54项是桌面级操作(比如抓取、放置、按按钮),10项需要全身协调(比如走到垃圾桶前、弯腰倒垃圾、铺床)。这些任务不需要为每一项单独训练策略——同一个模型通吃。
它的能力可以拆成三层来看:
首先是具身感知。给一张机器人眼前的画面和一句指令,模型能指出目标物体在哪、和其他物品是什么空间关系(比如“杯子在键盘右边”),甚至判断哪些区域可以安全抓取。这部分由 ER-1 模型承担,它基于 Qwen3-VL-4B 改造,经过500多万样本强化训练,在 RefSpatial-Bench 等7个公开评测中排名第一。
其次是动作生成。模型把任务指令直接映射成机器人可执行的动作序列。这里的关键是用了 RVQ(残差向量量化)技术,把连续的关节角度、末端位姿、灵巧手状态全部离散化成“动作 token”。这样一来,动作预测就变成了和文本生成一样的序列建模问题,视觉、语言、动作全塞进同一个 transformer 里处理。
最后是结果预判。在真正输出动作前,ER-Flow 层会插入掩码 token,同步预测“如果我这么做,场景会变成什么样”。比如伸手去拿杯子时,模型会先想象杯子被提起后的画面。这种“先想象再行动”的机制能减少无效尝试,避免撞到障碍物或抓空。
技术实现:统一架构如何工作
整个系统采用分层设计。底层是 ER-1,专注从图像和语言中提取结构化信息;中间是 ER-Flow,在 ER-1 的输出基础上加入动作建模和未来动态预测;顶层则是完整的 WLA-1.0,整合两者并通过后训练获得全身操作能力。
训练数据全部来自宇树自家机器人(主要是 G1 和 H1)的真实操作记录,涵盖不同光照、背景杂乱度和任务复杂度。2500小时听起来不多,但因为每帧都包含高维动作标签,实际信息密度很高。
动作表示方面,RVQ 把整个动作空间分成三组:灵巧手关节、手臂末端位姿、下肢关节。每组分别量化成离散 token,再拼成统一的动作序列。这样做的好处是,模型可以用语言模型擅长的方式学习“动作语法”——比如“先移动身体→再伸手→最后握紧”这样的组合逻辑。
推理时,输入是当前图像 + 自然语言指令。模型先通过 ER-1 生成场景理解,再由 ER-Flow 预测动作 token 和未来动态区域。解码阶段,这些 token 被还原成连续控制信号,通过宇树提供的接口发送给机器人控制器。
如何上手:从代码到真机
开发者可以从 GitHub 克隆项目代码(仓库地址:unitreerobotics/unifolm-wla),按 README 安装依赖。模型权重托管在 HuggingFace,用 huggingface-cli download 命令就能拉取 ER-1 和 ER-Flow。
跑通第一个 demo 很简单:加载 ER-1,输入一张机器人摄像头拍的照片和一句任务描述(比如“找出蓝色积木”),模型会返回目标位置和空间关系。这一步验证感知模块是否正常工作。
接着可以测试动作预测。加载 ER-Flow,输入同样的图像和指令,模型会输出一串动作 token 和对应的未来场景变化区域。你需要用官方提供的 RVQ 解码器把这些 token 转回连续值,才能喂给机器人。
要注意的是,开源权重只包含决策模型,不包含底层运动控制。要让真机动起来,还得接入宇树 G1/H1 的 SDK。建议先在仿真环境里小规模验证,再上真机,毕竟动作输出可能超出关节限位。
与竞品对比:开源 vs 封闭,专用 vs 通用
目前主流的具身智能模型里,Physical Intelligence 的 π0/π0.5 是主要参照。两者思路不同:π0.5 强调跨平台泛化,用混合架构(3B VLM + 动作专家)处理开放世界长程任务,比如折叠衣物;但它不开源,只能通过合作方 API 或租赁机器人使用。
UnifoLM-WLA-1.0 则走深度垂直路线。它专为宇树自家机器人优化,6B 参数全集成在一个模型里,任务覆盖虽不如 π0.5 广,但在已支持的64项任务上表现更稳定。最关键的是,它完全开源——代码、权重、技术报告都公开,高校和小团队也能本地部署研究。
动作表示上,宇树用 RVQ 统一离散化所有自由度,而 π0.5 采用“连续流+离散块”的混合方式。前者更适合语言模型架构,后者在精细控制上可能有优势,但工程复杂度更高。
另外,WLA-1.0 的“未来动态预测”机制是独一份。π0.5 靠“推理-行动交替”处理长任务(比如先思考步骤,再执行一段,再思考),而宇树选择在单次推理中同时生成动作和结果想象,更适合短到中程任务。
实际应用场景
家庭服务是宇树重点演示的方向。发布会上展示了叠衣服、铺床、倒垃圾等场景,这些任务都需要移动+操作协同,正好发挥全身控制的优势。由于模型基于真机数据训练,对家居环境中的杂乱、遮挡有一定鲁棒性。
在工业领域,它可以接手产线上的重复性操作,比如零件分拣、工具递送。虽然精度比不上专用机械臂,但胜在灵活——换任务只需改一句指令,不用重写整套程序。
物流仓储也是潜在场景。比如让机器人在货架间移动,识别包裹并搬运到指定区域。这类任务对导航和抓取的协同要求高,WLA-1.0 的统一架构能减少模块间误差累积。
对科研机构来说,这套开源系统提供了难得的端到端 VLA 基座。以往研究具身智能,要么用仿真数据(和现实差距大),要么自己攒数据(成本高)。现在可以直接基于 ER-1/ER-Flow 做增量实验,比如加新传感器或多机协作。
商业服务方面,展厅导览、商场递送等轻交互任务也能覆盖。不过目前模型对复杂人机对话支持有限,更适合固定流程的服务。
开源生态与后续计划
宇树这次开源相当彻底。除了模型权重,还提供了完整的训练数据格式说明、RVQ 编解码工具链、以及真机对接示例。社区已经有人尝试把 ER-1 移植到其他机器人平台,虽然动作部分需要重新适配,但感知能力可以直接复用。
根据项目主页 roadmap,后续会放出:
- 完整6B模型的训练代码
- 更多真机任务数据集(带动作标签)
- 多模态指令微调工具
- 与 ROS2 的集成包
长期来看,宇树希望把 WLA 系列做成具身智能的“基础模型”,类似计算机视觉里的 ResNet 或 NLP 里的 BERT。开发者可以在上面做领域微调,快速构建垂直应用。
不过也要看到局限。目前模型只适配宇树硬件,对其他机器人本体支持弱;任务库集中在操作类,缺少高层任务规划(比如“准备晚餐”这种多步骤目标);而且2500小时数据虽然扎实,但相比互联网级别的文本数据,规模还是小。
但无论如何,这是国内首个开源的端到端具身多模态大模型,而且真机验证过。对于想入门具身智能的开发者,它提供了一个低门槛的起点。