突破数据瓶颈:1万小时人类数据如何重塑人形机器人全身操作?
人形机器人行业的竞争重心,正经历一场从硬件堆料到算法内核的深刻转移。过去两年,我们见证了无数整机厂商在翻跟头、跳舞甚至跑马拉松等展示性视频上的激烈角逐,但这些炫技背后的行业共识逐渐清晰:决定机器人能力上限的,不再是关节扭矩或电机转速,而是其理解物理世界、预测环境变化并协调全身完成任务的认知能力。在这一背景下,世界模型(World Model)与视觉-语言-动作(VLA)架构成为了技术演进的核心高地。
然而,行业长期被三道难题束缚。首先是高质量真机演示数据的极度匮乏,采集成本高昂且难以规模化;其次是现有像素级视频预测模型计算开销巨大,且易受自身运动导致的视角抖动噪声干扰;最后是上下身控制割裂,导致全身协调性不足。针对这些痛点,智在无界(Being Beyond)发布了Being-M0.7,这是全球首个面向人形机器人全身移动操作的隐式世界动作模型(Latent World-Action Model, Latent WAM),标志着隐式世界模型能力从桌面灵巧操作向全身移动操作的重大跨越。
Being-M0.7的核心突破在于其数据策略与架构设计的创新。传统方案依赖昂贵的机器人本体数据采集,而Being-M0.7选择了一条“借势”路线:利用超10000小时以人为中心的混合模态数据进行预训练。这一策略基于一个核心判断:人类在物理世界中的交互数据蕴含了丰富的场景演化、物体动力学与身体协调先验,这些知识具有极强的可迁移性。通过让模型先从海量人类经验中学习世界运行规律,再迁移至机器人本体,有效绕开了真机数据稀缺的瓶颈。
在架构层面,Being-M0.7采用了Vision-Motion MoT(Mixture-of-Transformers)结构。这一设计巧妙解决了多模态数据对齐难题。模型为视觉和运动模态保留了各自的专属投影与处理模块,同时通过共享的多模态注意力机制实现跨模态交互。这意味着模型能够兼容三类数据:视觉-运动配对数据用于联合学习未来状态与轨迹,纯视频数据用于约束视觉分支,纯运动数据用于约束运动分支。这种统一框架使得不同来源、不同模态完整性的数据都能在同一个训练目标下发挥作用,极大提升了数据利用率。

更关键的是,Being-M0.7提出了一种人类与人形机器人共享的统一运动表征。通过构建以头部为根节点的坐标系,并简化为仅保留头部、双手和双脚的紧凑表示,模型有效弥合了人形结构与机器人体态之间的差异。这种表征不仅降低了不同数据集间的分布差异,还为推理阶段提供了丰富的运动反馈信号,支持全身协同控制。在预训练中,模型采用流匹配(Flow Matching)目标,在隐空间中联合预测未来环境状态与运动轨迹,从而避免了像素级预测带来的高昂算力消耗与噪声干扰。

为了验证全身移动操作能力,智在无界在真实人形机器人上进行了多项高难度任务测试。在“鱼缸捞鱼”任务中,机器人需理解水动力学特性,在视觉受水体折射扭曲的情况下,协调手臂完成动态目标捕捞,成功率达60%(3/5),显著优于GR00T-N1.6(20%)。在“镜像取物”任务中,机器人需通过镜面反射推断隐藏物体位置,Being-M0.7在综合测试中取得40%的成功率,而同级竞品仅为10%。这些结果表明,模型在部分可观测条件下的间接视觉推理与全身接近能力上具有显著优势。

此外,“移动置物取物”与“搬箱避障”任务进一步检验了长程任务中的状态保持与全身协同能力。在搬箱避障中,机器人面对负载变化与视野遮挡,能够动态调整身体朝向,侧身穿过狭窄空间,展现了多方向移动、避障与负载感知的统一闭环控制能力。这些演示并非预设轨迹的开环执行,而是基于实时观测、本体感知与未来预测的持续修正过程。

Being-M0.7在推理阶段实现了低频世界规划与高频动作控制的解耦。模型以较低频率生成未来的视频-运动规划,并将中间隐藏状态转换为可复用的策略缓存(KV Cache)。动作专家则读取该缓存,结合实时反馈以较高频率生成可执行动作。这种设计既保证了长期规划的合理性,又确保了高频控制的实时性与鲁棒性。真机数据采集环节搭建的基于PICO VR的全身遥操作系统,为这一过程提供了高质量的微调数据,帮助模型将预训练先验适配到具体机器人的控制空间。
从行业视角来看,Being-M0.7的出现预示着人形机器人竞争逻辑的又一次演变。随着硬件性能的提升,模型能否理解场景、预测变化并生成协调动作,以及背后是否存在可扩展的数据体系,将成为拉开差距的关键。大语言模型的发展经验表明,可规模化的数据与训练飞轮决定了技术路线的边界。Being-M0.7通过融合人类行为数据与机器人本体控制,构建了一套可持续扩展的多模态融合范式,为具身智能提供了从“看到什么输出什么”的模仿学习,向“理解世界并预测未来”的认知学习跨越的可能。

当理解成为行动的前提,人形机器人才能真正走出实验室,进入千行百业的复杂物理环境。Being-M0.7不仅是智在无界技术路线的延续,更是隐式世界模型在全身移动操作领域的一次重要验证。它证明了通过大规模人类数据预训练结合少量真机适配,可以有效解决具身智能中的数据与协调难题,为通用人形机器人的通用化进程提供了坚实的技术支撑与新的思考方向。
