李飞飞学生发起具身数据标准,光轮智能成唯一入局中国企业

0 阅读

在人工智能的发展历程中,数据集的标准化往往预示着技术范式的重大转折。2009年,李飞飞团队发布的ImageNet不仅催生了计算机视觉的爆发,更确立了一种通过大规模、统一标注数据来训练和评估模型的协作范式。如今,随着具身智能(Embodied AI)从实验室走向规模化应用,一个更为复杂的领域正急需类似的协作基础设施。由李飞飞的前博士生、佐治亚理工学院助理教授Danfei Xu发起的EgoVerse项目,正在尝试为机器人学习建立这样一套“活”的数据协作框架。在这一全球顶级标准共建联盟中,光轮智能成为唯一一家参与的中国企业,其背后折射出的是中国科技企业在底层数据基础设施与标准制定权上的重要突破。

破解“数据悖论”:从静态数据集到动态协作生态

机器人学习长期面临着一个显著的数据悖论:高质量的真机遥操作数据极度稀缺且成本高昂,而人类在真实环境中自然产生的行为数据却蕴含着丰富的策略、交互细节和环境适应逻辑,是更理想的老师。第一视角(Ego-view)人类数据因此被视为打通这一瓶颈的关键路径。然而,过去的人类数据集多为一次性项目,缺乏统一的结构、坐标体系和任务定义,导致不同团队采集的数据难以互通和复用。

EgoVerse的出现,旨在解决这一碎片化问题。它不仅仅是一个静态的数据集,而是一套持续增长的协作标准。目前,EgoVerse已公开包含1362小时的人类演示数据、约8万个片段(episode)、1965项任务以及240个场景。这些数据涵盖了相机位姿、三维手部信息以及细粒度的语言描述。更重要的是,EgoVerse构建了一个由佐治亚理工、斯坦福、苏黎世联邦理工等顶尖学术机构,以及Meta、Scale AI、光轮智能等科技公司组成的联盟。这种“学术定义标准+工业界规模化生产”的模式,正是当年ImageNet成功的关键要素。

全球协作网络:多元角色互补构建完整闭环

EgoVerse的复杂性在于,它涵盖了从数据采集硬件、任务定义、动作迁移到规模化运营的全链条。任何单一机构都难以独立完成所有环节,因此需要高度专业化的分工协作。

在数据采集硬件层面,Meta推出的Project Aria提供了行业首个专为大规模基础模型设计的专用数据采集眼镜,解决了空间感知与第一视角视频的同步记录问题;而Mecka AI则推动了基于iPhone和轻量化头戴装置的便携采集方案,降低了门槛,扩大了采集场景的多样性。这种软硬并行的策略,确保了数据源的广度与深度。

在数据处理与迁移层面,斯坦福大学的UMI(Universal Manipulation Interface)技术通过便携式手持夹爪采集真实环境中的操作,并将经验转化为可部署的机器人策略,解决了人类柔软双手与机器人刚性执行器之间的“具身鸿沟”。与此同时,Scale AI凭借其在AI数据基础设施领域的深厚积累,提供了从清洗、标注到质检的规模化生产线,确保原始数据能够转化为稳定可用的训练资产。

光轮智能的核心贡献:构建高质量数据的质量防线

在EgoVerse的诸多参与者中,光轮智能的独特价值在于其构建了一套贯穿端到云、涵盖生产全流程的质量控制体系。当具身数据迈向千万小时规模时,数据质量的瓶颈不再仅仅是采集设备的限制,而是分布的均匀性、动作的完整性以及标注的一致性。

光轮智能通过Agent驱动的数据采集质量监控,将质检节点前置。传统的数据质检往往在数据上传后进行,一旦发现关键动作缺失或视角遮挡,整段数据可能作废。光轮智能的Agent系统能够在采集现场实时检查设备状态、任务流程及动作完整性,并在风险发生时推动即时纠偏。这种从事后抽检到生产控制的前置管理,极大提升了数据的有效率。

此外,光轮智能致力于解决多硬件兼容带来的数据异构问题。无论原始数据来自Project Aria、iPhone还是其他多模态设备,光轮智能的EgoSuite平台都能通过统一的云端管线进行标准化处理。这包括视觉惯性里程计(VIO)恢复相机运动、三维手部与身体姿态标注,以及V7级动作语义标注。这种“硬件多元,标准一致”的理念,确保了不同来源的数据能够无缝进入同一个训练体系。

仿真与评测闭环:用物理验证定义数据价值

数据生产的最终目的是服务于机器人模型训练。如何判断一段人类演示数据是否真正具有学习价值?光轮智能引入了SimFoundry仿真平台与RoboFinals工业级评测平台,构建了数据价值的验证闭环。

SimFoundry将人类数据中的动作轨迹、物体关系转化为机器人可执行的仿真任务,而RoboFinals则通过标准化评测验证数据在不同机器人本体、场景和物理条件下的表现。如果某类数据在评测中导致机器人失败,这一反馈将直接指导下一轮的数据采集策略,例如补充特定角度、增加特定物体交互或调整人群分布。这种由评测结果反向驱动数据采集的机制,使得数据质量不再是主观判断,而是基于客观物理验证的工程标准。

标准制定权的转移:从使用者到共建者

除了EgoVerse数据标准,光轮智能还作为技术指导委员会成员参与了Newton物理仿真基础设施的建设。Newton由NVIDIA、Google DeepMind、Disney Research、光轮智能和Toyota Research Institute共同发起,旨在定义机器人仿真与物理建模的技术路线。

数据与仿真是物理AI发展的两大底座。EgoVerse解决了机器人“从哪里获得学习经验”的问题,而Newton解决了这些经验“如何在物理世界中被复现和验证”的问题。光轮智能同时参与这两套国际标准体系,标志着其角色已从单纯的技术应用者,转变为全球物理AI底层基础设施规则的共同定义者。

这一转变具有深远的行业意义。在过去,中国科技企业多习惯于利用全球开放的数据集进行模型训练,或在应用层进行创新。而通过参与EgoVerse和Newton的制定,中国企业开始深入到底层数据结构和仿真协议的定义中。这不仅提升了企业在全球产业链中的话语权,也为未来中国具身智能产业提供了更高质量、更标准化的数据燃料。

结语与展望

李飞飞团队当年通过ImageNet建立了视觉AI的共同语言,今天,以Danfei Xu和光轮智能为代表的参与者,正在为具身智能建立类似的协作框架。EgoVerse与Newton的并行发展,预示着物理AI行业将从单点技术竞争转向基础设施与生态标准的竞争。

光轮智能作为唯一进入这两大标准体系的中国企业,其贡献不仅在于技术能力的输出,更在于展示了如何通过工程化手段解决大规模数据采集中的质量与兼容性问题。随着EgoVerse联盟的进一步扩张和数据规模的持续积累,我们有望看到具身智能模型在泛化能力和任务适应性上的质的飞跃。而对于整个行业而言,建立统一、开放、高质量的数据标准,将是推动机器人从专用场景走向通用智能的关键一步。在这一进程中,全球协作与中国力量的深度融合,或将重塑未来智能硬件的竞争格局。