三个月估值12亿美元:机器人淘金潮里,先富起来的是卖动作数据的人
机器人缺的不是知识,而是“身体经验”
大语言模型能火起来,靠的是互联网上现成的海量文本、图片和代码。模型不用真的开店、写书或编程,光靠“读”人类留下的数字痕迹,就能学会语言、逻辑甚至写诗。

但机器人面对的是另一个世界。

网上有成千上万条“如何叠衬衫”的教程视频,可机器人要完成这个动作,远不止看懂画面那么简单。它得判断布料软硬、识别衣角位置、计算机械臂该走哪条路径、控制夹爪用多大力、感知衣服是否滑脱,还得在失败时重新抓取。这些信息——摄像头看到什么、关节转了多少度、夹爪何时闭合、任务最终成没成功——必须同步记录下来。
普通视频只能告诉机器人“人做了什么”,却没法直接告诉它“机器该怎么动”。一段真正有用的机器人训练数据,通常得包含图像、深度图、关节角度、末端执行器轨迹、夹爪开合状态、动作指令,甚至触觉和力反馈。有些精细任务连空间坐标和时间戳都得对齐。
更麻烦的是,这类数据没法像网页那样批量爬取。要获得一条可靠的机械臂操作轨迹,往往得让人亲自操控机器人完成任务;一旦失败,就得重摆物品、校准设备、再试一次。而且不同机器人的传感器布局、关节数量、控制接口都不一样,一套数据很难直接迁移到另一台机器上。
结果就是,机器人训练数据变成了一种昂贵的实体生产活动。语言模型吃的是现成的“数字遗产”,而机器人需要人类专门为它重建一套关于物理世界的“动作互联网”。
XDOF盯上的,正是这个缺口。
XDOF卖的不是动作视频,而是一座“数据工厂”
XDOF由加州大学伯克利分校的研究人员Philipp Wu和Fred Shentu等人创立。在创业前,他们开发过一套叫GELLO的低成本遥操作系统:用3D打印件和通用电机搭出一个小型控制器,结构模仿目标机械臂。人推这个小装置,真实机器人就能同步动作。据论文介绍,一套GELLO控制器物料成本不到300美元,比VR手柄更适合采集接触密集型操作数据——比如叠衣服时手指捏住布料边缘的细微调整。
这套技术成了XDOF商业模式的起点。
公司的数据业务大致分三层:
第一层,直接在客户自己的机器人上做遥操作。XDOF派人带设备进驻,按客户指定的场景和任务采集数据。这类数据与产品高度匹配,商业价值最高,但成本高、扩张慢。
第二层,用标准化机器人和遥操作设备,批量生产通用操作数据。比如折叠、抓取、放置、擦拭等常见技能。这些数据不绑定单一客户,更接近机器人基础模型所需的“通用语料”。
第三层,采集人类第一视角动作。操作员戴摄像头或动作捕捉传感器,完成包装、整理、清洁等日常任务。虽然数据不是机器人本体产生的,但能以更低的成本扩展任务和场景的多样性。
但XDOF真正卖的,不只是最后打包的数据文件。
机器人数据采集是个系统工程:硬件维护、操作员培训、任务脚本设计、设备校准、多模态数据同步、质量检查、失败标注、格式转换……任何一个环节出错,几百小时的数据就可能报废。客户买的其实是整套生产能力——从人、机器到数据交付的闭环。
因此,XDOF把自己定位为“机器人基础设施公司”,而非传统数据标注商。它还推出了Foundry数据平台,让客户能浏览样本、上传自有数据、调用完整数据集。
今年6月,XDOF联合学术机构公开了ABC-130K数据集。据其官网介绍,该数据集包含超13万条双臂机器人操作轨迹,总时长约3590小时,涵盖RGB图像、深度图、机械臂关节状态、夹爪开合信号和自然语言任务指令。开放这批数据,表面是支持学术研究,实则像一份产品样品:先让外界看到XDOF能生产什么,再向商业客户推销更大规模、更定制化的服务。
5000万美元年化收入,说明谁已经愿意付钱
最让资本兴奋的,不只是“机器人需要数据”这个故事,而是XDOF reportedly已接近5000万美元的年化收入。
这意味着,在人形机器人还没赚到真金白银之前,上游的数据服务商已经找到了付费方——主要是前沿AI实验室和机器人创业公司。
为什么这些技术实力强的客户不自己干?
首先,数据采集极度消耗运营能力。企业不仅要买机器人,还得建场地、养团队、训操作员,并确保不同批次数据的一致性。实验室或许能攒几百小时数据,但要扩到几千甚至几万小时,就变成了另一种组织挑战。
其次,机器人行业还在快速试错。一家公司可能同时测试多种机械臂、传感器方案和模型架构。如果每次技术路线调整都要重建数据团队,固定成本会非常高。外包给XDOF,相当于把部分固定投入转为可随项目伸缩的采购支出。
第三,机器人数据对质量的要求远高于普通图像标注。XDOF曾在内部实验中发现,给叠衣服模型加入更多“成功示范”后,模型表现反而变差。原因是一些看似成功的数据里,藏着无效移动、反复抓取和长时间停顿——模型把这些噪声当成了正确策略。
这说明,机器人数据不是越多越好。哪些动作有效、失败点在哪、任务是否真正完成,都需要结合具体机器人和模型来判断。客户买的不是廉价人力,而是对数据生产流程的理解。
不过,“5000万美元年化收入”这个数字也得谨慎看待。报道没说明其中有多少是稳定订阅、多少来自一次性项目、硬件交付或定制开发。如果收入主要靠为少数大客户搭建专属采集系统,那增长虽快,却未必有软件公司那样的高毛利和可复制性。
按12亿美元估值和5000万美元年化收入粗算,XDOF的市销率约24倍。资本显然不是按外包公司定价,而是在赌它能把劳动密集的数据采集,转化为标准化平台、可重复销售的数据资产和持续运转的数据网络。
“机器人时代的Scale AI”,也可能只是阶段性生意
XDOF常被比作“物理AI时代的Scale AI”——后者在大模型浪潮中帮科技公司处理数据,前者想在机器人时代占同样位置。
但机器人数据生意可能更复杂。
第一个挑战:头部客户可能最终选择自建数据能力。对通用AI实验室和领先机器人公司来说,真实运行数据不仅是训练材料,更是核心竞争资产。如果机器人已在工厂或家庭中持续产生数据,它们更倾向把采集、训练、部署放在同一闭环内,而非长期依赖第三方。XDOF的机会窗口,或许只在行业早期——当多数公司急需数据却无力自建产线时。
第二个挑战:跨机器人数据复用有限。语言模型能共享同一份文本,但机械臂的长度、自由度、夹爪类型、传感器配置各不相同。为A机器人采集的数据,迁移到B机器人时往往需重新适配。如果跨本体学习迟迟不成熟,XDOF就得持续做定制化项目,商业模式更像服务公司而非平台。
第三个挑战:业务仍依赖大量硬件和人工。建仓库、买机器人、修设备、训操作员都会烧钱。业务越快,场地和人力成本也得同步涨。若收入增长必须伴随相近速度的成本增长,就难有平台软件的规模效应。XDOF能否提毛利率,关键看它能否通过自动质检、统一数据格式和标准化设备减少人工干预。
第四个挑战来自替代技术。仿真环境、合成数据、普通人类视频、可穿戴设备、机器人自主探索……都在试图降低对真人遥操作的依赖。未来数据结构可能是“少量高质量真实操作 + 大规模仿真/视频”,而非无限增加遥操作时长。XDOF自己也在拓展人类第一视角数据和自动评估工具,说明它清楚:单靠人遥控机器人,撑不起长期估值。
竞争也已出现。Mecka等创业公司同样定位为“物理AI的数据与部署层”,试图从人体动作、传感器信息和真实场景中构建训练数据。这场竞赛最终比的不是谁有最多视频,而是谁的数据能让机器人更快学会任务、并在真实环境中稳定工作。
对中国机器人产业的启示:机会不只在“造本体”
XDOF的崛起对中国机器人产业也有启发。
中国有全球最密集的机器人供应链和丰富应用场景——电商仓库、制造工厂、餐饮门店、物业、家庭……处处都是可被学习的真实任务。但“有场景”不等于“有数据资产”。
如果工厂操作没被标准化采集,如果不同机器人数据格式互不兼容,如果数据只停留在单个项目里,再丰富的场景也难形成可复用的模型能力。
目前,中国企业普遍重视本体、关节、减速器和运动控制,却可能低估了数据生产体系的价值。未来更关键的问题包括:谁定义任务?谁记录失败过程?谁拥有工厂运行数据?数据能否跨机器人迁移?这些数据如何持续回流到模型训练中?
对机器人厂商来说,卖出一台设备只是开始。真正拉开差距的,是设备进入真实场景后,能否持续产生数据、迭代模型,再把改进能力部署到更多机器上。
对创业公司而言,机会未必是复制XDOF。更现实的方向,或许是围绕优势产业建垂直数据体系:为汽车厂采装配和质检数据,为电商仓采分拣和包装数据,为餐饮场景采制作和清洁数据。数据不必覆盖所有机器人,只要在一个高价值场景中证明模型成功率和部署效率,就能形成商业价值。
与此同时,数据采集还涉及员工隐私、劳动过程记录、商业秘密和跨境传输。如果摄像头长期记录工人如何操作,谁拥有这些动作数据?员工是否知情?数据能否用于训练其他客户的机器人?这些问题都需要提前建立规则。
XDOF的12亿美元估值,押注的不是今天的数据外包收入,而是一种可能性:成为连接机器人模型、本体和真实场景的基础设施。但这笔账还没算清——客户是否会长期外包核心数据?跨机器人数据能否复用?劳动密集型采集能否蜕变为平台级利润?这些都将决定XDOF最终是基础设施公司,还是热潮中的高端服务商。
在每一次技术淘金潮中,卖铲子的人往往最先赚钱。但不是每家卖铲子的公司,都能成为矿山的主人。XDOF接下来要证明的,已经不是机器人是否需要数据,而是自己能否掌控从采集、清洗、评估到模型改进的完整循环。真正值12亿美元的,不是那13万段动作视频,也不是仓库里的遥操作设备,而是让每一次人类动作,都能变成下一代机器人学习能力的那套系统。