1700万帧重构物理世界:ACE-Data-0如何破解具身智能数据困局
在人工智能从数字世界向物理世界延伸的进程中,具身智能(Embodied AI)被视为下一个技术高地。然而,当我们将目光从屏幕内的代码转向现实中的机械臂时,一个严峻的问题浮出水面:现有的数据体系是否足以支撑机器人理解复杂的物理规律?长期以来,视觉语言模型虽然在图像识别和文本生成上表现卓越,但在面对“打开橱柜”、“倒水”、“叠衣服”等涉及力反馈、空间几何和连续动作的日常任务时,往往显得笨拙且缺乏常识。这种能力的缺失,根源在于训练数据的维度单一与时空割裂。
近期,大晓机器人联合南洋理工大学S-Lab重磅开源了L5级多模态具身物理智能数据集ACE-Data-0。这一举措并非简单的数据量堆叠,而是对具身数据采集范式的一次根本性重构。ACE-Data-0包含150小时的高质量数据、1700万帧视频、200个任务类别以及7.5万个交互片段,其核心价值在于将真实家庭场景转化为可计算、可推理的物理智能“数据引擎”。
传统具身数据往往局限于L1至L4级别,主要支撑基础预训练或已知任务的拟合。这些数据通常由孤立的短视频片段组成,缺乏对接触压力、自然犹豫过程以及开放环境变量的记录。相比之下,ACE-Data-0迈入L5级标准,强调信息密度与物理因果关系的完整保留。它不再将活动切割为独立的原子动作,而是连续记录感知、行动、接触和状态变化的全过程。这种转变意味着,机器人学习的不再是静态的“动作模板”,而是动态的“物理过程”。
为了实现这一目标,ACE-Data-0采用了独特的双尺度采集系统,分别应对精细操作与长程活动的不同需求。在桌面尺度上,系统聚焦于指尖接触、抓握变化和物体细微运动。通过布置多视角摄像机、光学动作捕捉设备和触觉传感器,系统能够高精度记录抓取、倾倒、擦拭、切割等任务中的手部姿态与物体轨迹。而在房间尺度上,采集范围扩展至厨房、客厅、卧室等完整家居空间。利用广基线摄像机和全空间动作捕捉技术,系统持续记录参与者的全身运动、跨区域移动以及发生在场景不同位置的连续交互。
这两套系统并非孤立运行,而是共享统一的数据采集、同步、标定和质检流程。桌面尺度系统回答了“手与物体如何精细交互”的问题,而房间尺度系统则解决了“人如何在完整环境中移动、规划并完成任务”的难题。在采集过程中,参与者佩戴第一人称设备,系统同步记录四路鱼眼视频、IMU数据、头戴设备位姿、全身运动和手部关节状态。同时,多视角外部摄像机补足第一人称视角中容易被遮挡的身体和环境信息,确保每个活动时刻均由多个视角同步观察,并与可度量的人体、手部和物体状态对应。
多模态数据真正的挑战不在于设备数量的多少,而在于不同来源的信号能否在时空上精准对齐。摄像机、动作捕捉系统、触觉手套和音频设备通常拥有独立的时钟与不同的采样频率。即使只有几毫秒的时间偏差,也可能导致画面中的手尚未接触杯子,而触觉信号已经产生的逻辑错误。如果不同摄像机、人体和物体没有统一的空间基准,也无法准确建立几何关系。
ACE-Data-0通过严格的时间同步与空间标定,将视频帧、人体动作、物体状态、触觉读数和音频统一到同一条时间线上,并将所有元素配准至共享的世界坐标系。这意味着,每次采集都不是一组互不相关的数据流,而是一份对同一物理过程的统一记录。研究者可以直接查询某个视频帧对应的人体姿态、物体位置、接触压力和声音变化,也可以对比第一人称与第三人称视角下的同一事件。这种高精度的时空一致性,使得数据在遮挡、快速运动和长期任务中拥有更高的稳定性,让模型能够真正学习发生在同一时刻的视觉、动作、声音和接触信号。
在任务设计方面,ACE-Data-0摒弃了传统的脚本式采集,转而采用目标级指令。参与者只被告知最终任务目标,而不被要求遵循固定的操作流程。因此,他们可以自由选择物品、操作顺序和移动路径,甚至在过程中出现犹豫、改变计划、返回上一步或处理意外情况。例如,在整理房间的任务中,有人可能先收拾桌面,有人则先整理沙发;在准备食物时,不同参与者会选择不同的工具和顺序。
这些看似杂乱的差异,在标准化采集中常被视为噪声,但对于旨在进入真实家庭环境的机器人而言,却是必须理解的现实特征。长时序任务的难点不仅在于视频时长的增加,更在于前后动作之间的强依赖性。此前的决定会改变后续可执行的动作,物体可能离开并重新进入视野,子任务可能中断、重排或在其他位置继续。模型必须持续记住任务目标、物体状态和已经完成的步骤,而不能将活动视为一串彼此独立的动作。ACE-Data-0完整保留了这些自然变化,使数据不再仅提供理想化的动作模板,而是记录了人类真实完成任务时的规划、调整和恢复过程。
基于ACE-Data-0,研究团队构建了从底层信号、场景组成要素到具身交互理解的三级评测基准。第一级评估模型从视觉观测中预测接触与触觉信息的能力;第二级评估模型在遮挡、复杂姿态和持续运动下恢复人体与手部运动状态的能力;第三级则要求模型从视频中恢复接近、抓取、调整和释放等完整的手物交互过程。通过对30多种代表性方法的评测,研究发现现有模型在接触感知、严重遮挡处理、第一人称自运动适应以及长时间任务理解上仍存在明显的能力缺口。
这套分层评测体系的价值在于,它不仅判断任务最终是否成功,更试图定位模型失效的具体环节。一次失败可能源于未感知到接触,也可能来自物体状态估计错误、任务上下文丢失或动作顺序理解偏差。通过拆解这些问题,研究者可以更清晰地判断模型已经理解了什么,又在哪一层发生了能力断裂。这种细粒度的诊断能力,对于优化VLA模型、世界模型及机器人策略学习至关重要。
ACE-Data-0的开源,标志着具身智能数据建设从追求规模向追求质量与物理一致性的转变。它不仅仅是一批家庭场景活动视频,更是一套面向模仿学习、世界模型、视觉—语言—动作模型(VLA)、机器人策略学习及人类示范向机器人迁移的基础设施。通过保留真实世界中的物理联系、任务结构、接触反馈与状态演化,ACE-Data-0为通用物理智能走进真实世界提供了更完整、更可扩展的数据底座。
未来,随着具身数据引擎、通用具身基础模型和世界模型的进一步研发,数据的质量将成为决定机器人智能水平的关键变量。ACE-Data-0中的“0”代表这套具身数据体系的起点,预示着从人类自然行为到机器人通用能力的可拓展路径正在被逐步打通。从“看见动作”到“理解行动”,从孤立视频到连续物理过程,这一数据集正在为具身智能建立一条更接近真实世界的数据入口,让每一次真实生活中的感知、接触与行动,都成为机器人理解物理世界的训练信号。