具身智能数据战:Maxinsights如何用150万小时人类经验训练机器人

0 阅读

机器人开始学人做事

9月3日,OpenAI发布GPT-6 Astra,在ARC-AGI-3测试中拿下99.9%的成绩。这个基准专门考察AI能否在陌生环境中自主探索、理解规则并规划行动。一天后,Robocurve把Astra接入真实双臂机器人,让它完成“抓起积木放进碗里”的任务——20次成功19次。

图片

这两个结果透露出一个明确信号:最前沿的大模型正在把能力边界从纯数字世界推向物理世界。当模型不再只是回答问题,而是要观察环境、规划动作并实际执行,它所依赖的数据类型也发生了根本变化。

图片

过去几年,大模型靠互联网文本完成Scaling。但机器人长期卡在真机数据上——采集成本高、积累慢,还往往绑定特定硬件。现在,一条新路径正在浮现:直接学习人类每天都在做的真实物理交互。

图片

今年8月,Dyna Robotics首次将人类第一视角数据(egocentric data)规模推到100万小时。随着数据从1000小时逐步增加到百万小时,其模型Dyna-2的表现持续提升,没有出现明显饱和。即便面对预训练阶段从未见过的任务,Dyna-2也展现出更强的泛化能力。

图片

Genesis AI的机器人基础模型GENE-26.5同样采用了这类数据,把人类活动中的视觉、动作与交互过程纳入训练。这些实践共同指向一个趋势:机器人训练正在转向大规模吸收真实人类经验。

图片

《连线》杂志称,一场“egocentric data boom”正在兴起。越来越多机器人公司开始使用佩戴摄像头的采集员录制第一视角视频,甚至有投资人预计,领先企业未来几年会采购数亿小时此类数据。

文章配图

但问题随之而来:谁能把这些视频里的经验,高效、持续地变成模型真正能用的训练数据?

图片

Maxinsights浮出水面

图片

在Dyna-2和GENE-26.5惊艳表现的背后,一家名为Maxinsights的公司逐渐被注意到。它是Dyna-2最大的数据合作伙伴,也是GENE-26.5的独家egocentric data供应商。Google DeepMind、Figure、1X以及某头部大模型公司也曾与其开展数据合作。

这家2024年成立于旧金山湾区的Physical AI公司,已将数据服务铺到六大洲,并于今年3月进入中国市场。官方称其为“最早实现规模化、且累计交付量最大的第一视角数据公司”。

团队核心成员来自Waymo、Meta、Google、QCraft、小鹏、博世等自动驾驶与AI公司,具备从采集、清洗、算法、标注到模型训练的完整工程经验。这套曾支撑自动驾驶发展的数据闭环能力,如今被迁移到具身智能领域。

随着与硅谷基础模型和机器人团队合作加深,Maxinsights逐步搭建起覆盖数据采集、质量控制、理解、标注到交付的完整基础设施。

这背后是对机器人学习本质的重新理解:机器人自己采集的操作数据往往局限于特定硬件和任务,而人类每天在各种场景中完成大量物理交互——拿起杯子、整理物品、打开抽屉、使用工具。这些日常动作记录了物体如何响应接触、双手如何协作,以及环境状态如何随动作变化。

Dyna Robotics在技术报告中指出:“人类执行真实任务时产生的sensorized recording,规模几乎没有上限,同时包含了机器人manipulation policy所需要学习的世界动态和手物交互信息。”

换句话说,如果机器人想获得类似互联网规模的训练资源,未必需要等机器人自己工作几亿小时。它可以先学习已经在人类世界运行了无数年的经验库。

截至目前,Maxinsights已建立覆盖六大洲的采集网络,累计积累150万+小时带手部追踪和语言标注的高质量数据,历史累计向客户交付超过200万小时。

但它能在具身智能数据链顶端站稳脚跟,靠的不只是庞大的“视频仓库”,更是一座“智能工厂”。

主动采集:告别盲目上量

当数据规模跨过百万小时,单纯堆人、堆量的边际效益开始递减。具身智能的数据逻辑变了。

Maxinsights最有远见的一步棋,是把关注点从“每月多采多少小时”转向“如何缩小人类数据与机器数据之间的Embodiment Gap(跨本体差异)”,并将其降维成一个可通过流程和算法解决的工程问题。

他们认为,未来具身智能的数据能力会沿两个方向演进。

首先是Experience Scale(经验规模)。机器人需要接触足够丰富的人类活动、环境、物体和任务,才能形成对物理世界的通用理解。因此,行业会继续从百万小时走向千万小时,让人类经验成为训练通用机器人模型的基础。

但规模扩大后,另一个问题凸显:模型看到了更多视频,却没有看到更多新世界。如果新增数据只是重复已有场景,数量增长不会带来同等能力提升。

这种对有效数据的需求,首先传导到采集方式上。Maxinsights的解法是Coverage-aware Collection(覆盖感知采集)

传统被动采集在百万小时后容易陷入低质复刻——满屏都是固定环境下的简单搬运、桌面抓取,系统“免疫”了。

他们的做法是:依托内部Agent平台,对现有数据池进行反向诊断,像雷达一样锁定分布盲区。一旦发现稀缺环境、罕见物体或复杂受力动作,Agent立刻下发指令,定向调度全球5000余名采集员和专业设备补采。

例如,缺少厨房长尾物体?安排对应采集。缺少柔性物体操作?补充相关任务。缺少复杂受力状态?针对性设计流程。

这套流水线还自带清洗功能,能自动识别并剔除无效片段、刻意摆拍和视角偏移等低质数据。

自研模型才是护城河

除了规模,Maxinsights关注的第二个维度是Experience Density(经验密度)

一小时人类操作视频,有的只能告诉模型“手移动到了某个位置”,但高价值数据包含更多维度:手部姿态、身体协同、物体状态变化、人与环境的接触关系、动作的时间节奏。

信息越丰富,模型学到的物理规律越多。未来高价值的具身数据,不是追求更多小时,而是让每个小时承载更多信息。

关键问题变成:如何充分释放每一帧画面中的信息价值?

他们的思路是从Task Coverage(任务覆盖)转向更细粒度的State Coverage(状态覆盖)。

在一段演示中,视频不再被压缩成一句“打扫卫生”的粗糙标签,而是变成一个高维数据结构:包含场景理解、任务边界、三维空间关系、双手微操轨迹、动作时间序列。

它尽可能保留了人类操作的空间、动作与时序信息,让视频变成Dyna-2这类模型可直接用于学习物理交互的训练数据。

支撑这套管线的,是Maxinsights自研的AI引擎——MaxVLM,一个专为具身场景强化的视频理解大模型。

在演示中,系统构建了一棵严密的逻辑树:

  • ENVIRONMENT(环境): Hotel room
  • TASK(主任务): Clean the room
  • SUBTASK(子任务): 随时间轴精准切分出Collect the trash(收垃圾)、Wipe the table(擦桌子)、Discard the water bottles(丢水瓶)、Tie off the trash bag(扎垃圾袋)等环节
  • INSTRUCTION(微操指令): 细化到每只手的动作,如“双手将纸屑扔进垃圾桶”

据透露,MaxVLM在具身场景下的语言标注和视频理解能力,能对标公开SOTA视频理解模型,但推理成本压缩到十分之一。这种成本控制力,是撑起百万小时量产的生死线。

视频右侧的画面,是重建出的3D点云空间。随着手部移动绘制的彩色线条,正是系统从第一视角视频中逆向推导出的双手在三维空间中的精确运动轨迹。

为了保证轨迹稳定精确,Maxinsights沿用了自动驾驶领域的SLAM算法——先持续估计摄像头自身在三维空间中的位姿变化,再将每一帧的手部位置统一映射到同一世界坐标系中。

这样,头部晃动和相机位移带来的干扰被剥离,留下更接近真实动作的轨迹。即使手部遮挡或镜头晃动,右侧的空间坐标仍能保持稳定追踪。

提出“Yield”:数据也要讲良率

当这套自动化基础设施贯通,数据飞轮开始转动:更聪明的主动采集 → 更强的模型理解与3D还原 → 自动质检与标注精度提升 → 边际生产成本下降 → 吞吐更大规模的人类经验。

当同行还在讨论“采了多少视频”时,Maxinsights已率先提出一个工业概念——Yield(良率)

芯片圈的人对良率不陌生:晶圆下线后,并非每颗芯片都能点亮。最终合格出厂的占比,才是衡量晶圆厂真实产能和工艺壁垒的标准。

如今,这套法则被平移到机器人数据赛道。衡量的是一种“提纯率”:当你采集了1万小时真实数据,最终有多少能真正转化为大模型可消化的有效经验?

得益于自建工厂,Maxinsights数据集良率达98%

这或许才是“精品150万小时”的真正战略意义——它不仅是一个训练素材库,更是一个随规模膨胀而越滚越强的超级反馈闭环,由此形成一道越来越难复制的护城河。

下一站:1000万小时

如今看来,150万小时只是序章。

Maxinsights给自己定下的下一个目标,是积累1000万小时高质量、可直接用于模型训练的数据。随着数据飞轮持续转动,这个目标正越来越近。

大模型时代,人类发现互联网不仅是一张信息网,也是一座巨大训练集。但Physical AI没有现成的训练集——现实世界的经验分散在人、机器、家庭、工厂和无数日常动作中。

Maxinsights希望把这些从未被结构化记录的人类经验,变成Physical AI可持续消费的数据基础设施。

未来,这座设施还会变得更聪明、更广阔:通过视频理解和智能检索,把海量原始视频转化为可搜索、可组合的数据资产;与仿真数据结合,进一步拓宽训练边界。

最终,它会更像一个物理经验引擎——能持续理解真实世界、发现数据缺口,并不断生产机器人真正需要学习的物理经验。