具身智能新范式:Noe-0如何用无本体数据构建世界动作模型?
在人工智能迈向物理世界的关键阶段,具身智能(Embodied AI)被视为连接数字智能与现实行动的核心桥梁。然而,长期以来,该领域的发展受限于数据获取方式的瓶颈——高度依赖在受控环境中通过遥操作采集的机器人执行数据。这类数据虽具备结构化优势,却难以反映真实世界的复杂性、多样性和不可预测性。近期,穹彻智能发布的具身智能预训练模型 Noe-0 提出了一种颠覆性路径:全链路采用无本体采集的真实人类操作数据,并基于 World Action Model(WAM)架构实现从感知到行动的端到端学习。这一方案不仅挑战了行业惯性,更可能为具身智能的规模化(Scaling)开辟新方向。

传统遥操作数据采集通常在标准化实验室或工位中进行:固定桌面、有限物体种类、预设任务流程。这种“数据工厂”模式虽能保证数据质量与一致性,却本质上是一种对真实世界的简化与过滤。机器人在此类数据上训练后,往往在面对家庭厨房的杂乱台面、门店货架的不规则摆放或户外光照变化时表现脆弱。问题核心在于:数据分布与目标部署环境存在显著偏移。更关键的是,遥操作过程本身效率低下——同一任务由人类直接完成仅需1分钟,通过遥操作可能耗时3至5分钟,导致动作节奏机械、缺乏自然流畅性,进一步削弱了数据的行为真实性。

Noe-0 的突破在于彻底摒弃对机器人本体的依赖,将数据采集源头前移至人类在真实环境中的自然操作。这意味着采集不再发生在为机器人定制的工位上,而是遍布家庭、便利店、维修车间等日常场景。采集员使用名为 RoboPocket(RP)的便携设备,在自身生活或工作空间中自主构想并执行任务。例如,煮一碗方便面涉及开包装、烧水、下面、搅拌等多个连续动作,且伴随蒸汽遮挡镜头;又如电气接线任务需精准区分线材颜色、端子类型并按规范顺序装配。这些任务天然包含视角变化、光照干扰、物体遮挡及非结构化交互,构成了极具挑战但高度真实的训练样本。

值得注意的是,Noe-0 所采用的“无本体数据”并非简单指代“非机器人采集”,而是强调采集端与最终执行端在形态上解耦。RoboPocket 的设计体现了“同构但适人”原则:其末端夹爪形态尽可能模拟目标机器人执行器(如二指夹爪),但整体结构优化为人手佩戴的舒适性与操作自由度。这种设计确保了采集的动作轨迹在运动学上与机器人兼容,同时保留了人类操作的自然性与高效性。截至目前,该设备已覆盖中国50余个城市,累计采集超数十万小时视频与动作数据,对应数十万种不同任务类型——平均每种任务仅约一小时数据,凸显其“广度优先”的数据策略。

在模型架构层面,Noe-0 采用 World Action Model(WAM)作为核心技术路线。这一范式由英伟达 Jim Fan 等人提出,主张将策略学习的基础从语言模型转向视频世界模型。传统视觉-语言-动作(VLA)模型依赖语言指令作为中间媒介,但在复杂物理交互中,语言描述往往模糊或缺失。WAM 则直接以视频预测为核心目标:给定历史视频帧序列及当前状态,模型需预测下一时刻的视觉状态,并同步输出实现该状态所需的机器人动作。这种联合建模迫使模型深入理解物理规律——例如物体如何因抓取而移动、液体如何因倾倒而流动——并将此理解转化为可执行的控制信号。

尤为关键的是,Noe-0 的 WAM 架构展现出强大的跨本体迁移能力。研究团队发现,即使训练数据来自人类手持 RoboPocket 采集,而推理部署于不同构型的机械臂,Pixel Prediction(像素级视频预测)任务仍能显著提升迁移效果。其机制在于:模型在预测未来帧时,必须区分哪些像素变化源于任务本质(如杯子被拿起),哪些仅是本体外观差异(如手部 vs. 金属夹爪)。这种训练压力促使模型学习到与具体执行器无关的物理因果关系,从而在更换末端执行器时无需大规模重训,仅需微调动作输出头即可适应新硬件。

要支撑如此大规模、高多样性的数据生产,传统人工管理流程显然难以为继。穹彻智能为此构建了 AI-Native 数据基础设施,将人工智能深度嵌入数据生命周期的每个环节。该系统包含两大核心组件:端侧的 RoboPocket 与云端的 Data Engine。后者通过一个名为 Data Agent 的智能体,实现对数千名分布式采集员的高效协同。Data Agent 支持自然语言交互,可自动执行任务审核、数据查询、质量问题追踪与反馈推送。例如,当某采集员频繁出现镜头遮挡问题,系统可自动识别并推送针对性改进建议,而非依赖人工逐个沟通。

在数据处理后端,AI 自动化大幅降低标注与质检成本。系统采用“AI 主导 + 人工兜底”策略:高置信度样本由模型自动标注,仅将低置信或长尾案例交由人工处理。同时,端侧设备集成初步质检模块,实时检查数据完整性与自然度,避免无效数据上传。这种设计使得数据管理成本的增长速度远低于数据规模的扩张速度,真正实现了 Distributional Scaling——即通过增加任务种类、物体类型、空间场景和现实变异来扩展经验分布,而非简单重复同类任务。





Noe-0 的意义远不止于一个模型发布。它验证了一条技术路径的可行性:无需预先为每个新任务搭建专用机器人采集环境,即可将广泛存在的人类操作经验转化为机器人能力。当数据基础设施足够成熟,未来任何人在日常生活中完成的操作——无论是整理书架、插花还是修理家电——都可能通过轻量级设备被记录并流入训练体系。这种“人类行为即数据”的范式,将极大加速具身智能的迭代速度与任务覆盖广度。
更重要的是,Noe-0 实现了训练链路的连续性。从预训练到后训练,全程使用同源的无本体数据,避免了传统方法中因数据分布切换导致的能力断层。模型在预训练阶段学习通用物理交互规律,在后训练阶段则针对特定任务进行微调,整个过程保持动作语义的一致性。这种端到端的连贯性,是构建真正通用具身智能的关键前提。
当然,挑战依然存在。无本体数据虽具广度,但在特定高精度任务(如微创手术)上可能缺乏足够深度;跨本体迁移在极端形态差异下仍需验证;大规模分布式采集的伦理与隐私问题也需审慎处理。但 Noe-0 的实践表明,拥抱真实世界的混乱与多样性,而非试图将其简化为可控变量,或许是通向强具身智能的必经之路。
随着视频生成模型日益成为机器人世界模型的底座,对物理世界动态的深层理解将成为核心竞争力。Noe-0 通过无本体数据与 World Action Model 的协同,不仅提供了一种高效的数据获取方案,更构建了一个可持续进化的智能闭环:真实世界产生人类行为,行为被转化为训练数据,数据驱动模型进化,进化后的模型再通过机器人行动反哺现实。这一循环一旦形成正反馈,具身智能的 Scaling 或将迎来真正的爆发点。