揭秘L5级具身智能:ACE-Data-0如何重构家庭场景物理交互数据引擎?

0 阅读

突破数据瓶颈:从“看见动作”到“理解物理”的认知跃迁

在具身智能(Embodied AI)从实验室走向家庭场景的过程中,数据质量往往比数据规模更具决定性意义。长期以来,行业面临的核心痛点在于:现有的视觉语言模型(VLM)和视频动作模型虽然能够识别“发生了什么”,却难以精确重构“如何发生”的物理细节。普通视频记录缺乏接触压力、手部微操和触觉反馈,而实验室环境下的动作捕捉数据又往往过于理想化,缺少真实家庭场景中复杂的遮挡、自然延误和开放性变量。

针对这一痛点,大晓机器人联合南洋理工大学 S-Lab 重磅开源了 L5 级多模态具身物理智能数据集 ACE-Data-0。这一数据集不仅是一个数据集合,更被定义为面向泛化、反思与进化的“物理智能数据引擎”。它基于全球首创的具身模型信息密度定律,通过以人为中心的环境式数据采集方案 2.0,将真实家庭场景转化为可持续记录、统一标定和精准同步的学习空间。ACE-Data-0 的问世,标志着具身智能数据建设从 L1-L2 的基础预训练阶段,正式跨越至 L5 级的高密度物理交互记录阶段,为通用物理智能的规模化产业落地奠定了坚实底座。

L5级数据标准:信息密度驱动的物理交互重构

要理解 ACE-Data-0 的价值,首先需要明确“L5级”数据的内涵。在具身数据分级体系中,L1-L2 级数据主要支撑基础预训练,仅能提供粗略的语义信息;L3-L4 级数据虽能支持已知任务的拟合,但往往局限于静态或简单动态场景。相比之下,ACE-Data-0 所处的 L5 级数据,深度融入了接触压力、自然出现的犹豫与恢复过程,以及真实家庭场景中的开放行为变量。

从数据体量来看,ACE-Data-0 包含 150 小时的连续数据、1700 万帧视频、200 个任务类别、50 名参与者的表现,覆盖 7.5 万个交互片段。这些并非孤立的片段,而是原子级人—物交互、长时序家庭场景活动链及人与场景交互的完整集合。更重要的是,数据同步采集了第一人称视频、多视角第三人称视频、全身与手部运动、物体六自由度轨迹、多通道音频与触觉信号,并将全部模态对齐至同一时间线和空间坐标系。

这种高密度记录意味着,数据不再仅仅是画面的堆砌,而是物理过程的完整复现。视觉描述外部变化,运动数据还原轨迹,音频记录碰撞状态,触觉提供压力与滑动信息。不同模态共同构成对同一次真实交互的“全息”观察,使模型能够真正学习发生在同一时刻的视觉、动作、声音和接触之间的因果关系,而非仅仅识别物体类别或动作标签。

双轨采集架构:兼顾精细操作与长程活动的空间覆盖

家庭场景中的任务具有显著的空间异质性。精细的手部操作(如折叠衣物、倾倒液体)需要极高的空间分辨率和触觉精度,而长程的家庭活动(如烹饪流程、整理房间)则要求大范围的环境覆盖和全局视角的统一。单一采集系统难以兼顾这两类截然不同的需求,因此大晓将环境式采集引擎 ACE 设计为桌面尺度与房间尺度两套互补配置。

桌面尺度系统专注于精细化手—物交互。在操作区域周围,系统布置了多视角摄像机、光学动作捕捉设备和高灵敏度触觉传感器。这一配置重点记录抓取、倾倒、擦拭、切割、折叠等任务中的手部姿态、物体轨迹和接触变化。其核心目标是回答“手与物体如何精细交互”,捕捉指尖的压力分布、物体的微小位移以及工具使用中的力学反馈。

房间尺度系统则覆盖厨房、餐厅、客厅、卧室等完整家居空间。通过广基线摄像机阵列和全空间动作捕捉系统,该配置持续记录参与者的全身运动、跨区域移动,以及发生在场景不同位置的连续交互。其核心目标是回答“人如何在完整环境中移动、规划并完成任务”,包括长时序下的路径规划、环境导航以及与家具、大型家电的交互。

这两套配置共享统一的数据采集、同步、标定、质检和标注流程。在采集过程中,参与者佩戴第一人称设备,系统同步记录四路鱼眼视频、IMU、头戴设备位姿、全身运动和手部关节状态;多视角外部摄像机则补足第一人称视角中容易被遮挡的身体和环境信息。这种双轨制确保了无论任务尺度如何,都能获得高精度、无死角的物理监督信号。

时空同步与目标级采集:保留真实世界的“噪声”与“差异"

多模态数据最大的挑战并非采集设备的堆叠,而是不同设备产生的数据能否准确对应。摄像机、动作捕捉系统、触觉手套和音频设备通常拥有独立的时钟和不同的采样频率。即使只有几毫秒的时间偏差,或几毫米的空间基准错位,都可能导致模型学习到错误的因果关联——例如画面中手尚未接触杯子,触觉信号却已产生。

ACE-Data-0 通过严格的时间同步与空间标定,解决了这一难题。所有视频帧、人体动作、物体状态、触觉读数和音频被统一到同一条时间线上,外部摄像机、第一人称设备、人体、双手和物体均被配准至共享的世界坐标系。研究者可以直接找到某个视频帧对应的人体姿态、物体位置、接触压力和声音变化,确保数据在遮挡、快速运动和长期任务中拥有稳定的一致性。

此外,ACE-Data-0 摒弃了传统的脚本式采集,采用“目标级指令”采集策略。参与者仅被告知最终任务(如“整理桌面”或“制作三明治”),而不被要求遵循固定流程。这意味着参与者可以自由选择物品、操作顺序和移动路径,甚至可能在过程中犹豫、改变计划、返回上一步或处理意外情况。例如,同样是整理房间,有人先收拾桌面,有人先整理沙发;同样是准备食物,不同参与者会选择不同工具和顺序。

在标准化采集中,这些差异常被视为噪声被剔除。但在 ACE-Data-0 中,这些自然变化被视为宝贵的学习资源。长时序任务的难点不仅在于视频长度,更在于“决策的前置性”——先前的决定会改变后续可执行的动作,物体可能离开并重新进入视野,子任务可能中断或重排。模型必须持续记住任务目标、物体状态和已完成的步骤。ACE-Data-0 保留了这些真实生活中的规划、调整和恢复过程,使数据不再提供理想化的动作模板,而是成为机器人理解复杂物理世界和人类行为多样性的关键入口。

三级评测基准:从信号推断到交互理解的全面检验

基于 ACE-Data-0,大晓构建了从底层信号、场景组成要素到具身交互理解的三级评测基准,系统检验模型在接触感知、人体与物体状态恢复、手—物交互理解等关键环节的真实能力。这一基准不仅仅判断任务是否成功,更旨在诊断模型在何处失效。

第一级评测为“底层信号推断”,研究模型能否从视觉观测中预测接触与触觉信息。这要求模型具备“视触联觉”能力,即通过视觉线索推断出不可见的力学交互。

第二级评测为“场景组成要素恢复”,评估模型在严重遮挡、复杂姿态和持续运动下,恢复人体与手部运动状态的能力。这是理解复杂动作的基础,要求模型能够补全视觉缺失部分的信息。

第三级评测为“具身交互理解”,要求模型从第一人称和第三人称视频中恢复接近、抓取、调整和释放等完整手—物交互过程。这涉及对多模态信息的综合推理,包括时序逻辑和空间几何关系。

研究团队对 30 多种代表性方法进行了评测,结果显示,现有模型在接触感知、严重遮挡、第一人称自运动、极端视角和长时间任务中仍存在明显的能力缺口。通过分层评测,研究者可以精准定位模型是在感知层、状态恢复层还是交互理解层发生断裂,从而指导模型架构的优化方向。

迈向通用物理智能:ACE-Data-0 的产业应用前景

ACE-Data-0 的价值远超评测基准本身。由于其第一人称视频、多视角第三人称视频、人体与物体轨迹、音频、触觉和语言标注处于统一时空框架,该数据集可直接服务于模仿学习、机器人策略学习、世界模型(World Models)、视觉—语言—动作模型(VLA)以及人类示范向不同机器人本体的迁移。

在大晓机器人看来,具身数据建设的核心在于保留真实世界中的物理联系、任务结构、接触反馈与状态演化。ACE-Data-0 中的“0”代表这一数据体系的起点,而非终点。随着数据的积累和模型的迭代,未来将形成从人类自然行为到机器人通用能力的可扩展路径。

通过 ACE-Data-0,具身智能正在从“看见动作”向“理解行动”转变,从孤立的视频片段向连续的物理过程迈进。这一数据集为全球具身模型提供了一扇窗,透过它,机器人不仅能看到日常生活的表象,更能洞察支撑这些行为背后的物理规律与认知逻辑。随着更多研究机构和开发者接入这一数据引擎,通用物理智能加速跨越实验验证、走进千家万户的步伐将显著加快。