具身智能数据狂飙:日薪30元采集员如何撑起150亿估值帝国?

4 阅读

具身智能(Embodied AI)作为人工智能物理落地的终极形态,正经历着从算法模型向数据基础设施转移的关键转折期。随着人形机器人、自动驾驶车辆及工业自动化设备对真实世界交互数据需求的指数级增长,一条围绕“数据要素”的新型产业链迅速成型。这条链条呈现出极端的二元结构:底层是高频、重复、低薪的人力数据采集,顶层则是高估值、高利润率的数据资产运营。

采集端:被标准化的“数字劳工”

在苏州某数据采集中心的清晨,24岁的张月开始了她的一天。她的工作内容看似简单:系鞋带、叠被子、开柜门。然而,这背后是一套严密的标准化流程。张月身上佩戴着5个高清摄像头或运动相机,每一个关节的角度、每一次肌肉的发力、甚至视线的焦点,都被转化为视频流数据。

这种被称为“居家数据采集员”的岗位,本质上是具身智能训练数据的初级生产者。根据行业调研,此类兼职岗位的时薪普遍在30元至40元之间。尽管日薪标注为250元左右,但有效工作时长受到设备的严格限制。传感器故障、镜头校准偏差、主机过热等问题频繁发生,导致采集员往往需要花费大量时间调试设备,而非实际采集。

数据采集的标准化程度极高,且缺乏弹性。在居家场景中,采集员必须连续工作8小时,而在室外场景如超市理货或汽修厂巡检,虽然时长要求略低,但工作地点频繁变动,增加了通勤成本与管理难度。更重要的是,采集员与机器人公司之间没有直接雇佣关系,而是通过层层中介分包。这种去中心化的用工模式,极大地降低了企业的用工风险,但也加剧了底层劳动者的不稳定性。

与小陈所在的“真机遥操”岗位形成对比,居家采集属于“无本体采集”模式。小陈在专业数采中心操作机械臂,日薪370元,但面临着更高的年龄筛选和枯燥感。数据显示,夜班采集员中,第一天离职率高达60%-70%。这种高强度的重复劳动,不仅是对体力的消耗,更是对注意力的极致压榨。采集员们如同流水线上的螺丝钉,为机器人的“大脑”提供着最基础的感官反馈。

数据缺口:200倍的供需失衡

具身智能的核心痛点在于“数据荒”。与大语言模型(LLM)可以从互联网海量文本中预训练不同,机器人需要的是在真实三维空间中“拿、放、走、抓、避障”的具身数据。这些数据具有极高的复杂度、私密性和物理依赖性,无法通过简单的爬虫获取。

据行业测算,训练一个接近人类水平的具身智能模型,需要10亿小时级别的有效操作数据。然而,目前全球有效供给仅约500万小时,供需缺口高达200倍。这一巨大的真空地带,使得数据成为具身智能时代最稀缺的资源。

数据供给的瓶颈主要源于采集成本与场景覆盖之间的矛盾。实验室和工厂环境数据容易获取,但难以覆盖家庭、商场等“毛细血管”般的复杂场景。居家采集员的出现,正是为了解决这一痛点。通过低成本的人力部署,企业能够以极低的边际成本获取海量的长尾场景数据。

在这种供需极度失衡的市场下,数据定价权完全掌握在服务商手中。目前,具身智能数据的总体定价在200-500元/小时,其中真机遥操数据因数据质量最高,市场价可达500-1000元/小时。而无本体采集数据,虽然质量略逊于真机数据,但凭借规模效应,正逐渐成为一种高性价比的补充方案。

产业链重构:卖水人的百亿估值

在数据采集端的利润微薄与机器人企业的巨额研发烧钱之间,数据服务商却成为了最大的赢家。

光轮智能,一家成立于2023年初的数据服务商,目前估值已突破150亿元。在最近两周内,该公司连续完成两轮共计20亿元的融资,估值甚至超过了部分头部机器人本体制造企业。其核心逻辑在于“数据复售”。一份高质量的数据采集完成后,可以被加工成标准化的数据集,同时出售给智元、银河通用等多家机器人公司。

这种模式打破了传统数据“一次性投入、一次性产出”的限制。据透露,部分优质场景数据的复售率超过10倍。2026年第一季度,光轮智能新增订单达5.5亿元,这一数字甚至超过了其2025年全年的总和。这种高毛利、高周转的商业模型,使得数据服务商在一级市场中备受资本青睐。

除了独立数据服务商,头部机器人企业也在加速布局数据基础设施。宇树科技在冲击IPO的招股书中坦言,前期研发侧重本体与控制,在“大脑”模型上投入不足,计划将近50%的募资用于搭建大规模真实数据集。这标志着数据已成为具身智能落地不可或缺的基础设施。

技术路径之争:无本体 vs. 真机遥操

在数据采集领域,存在两条主要技术路径:真机遥操与无本体采集。

真机遥操(Teleoperation)通过VR设备或外骨骼操控真实机器人,记录力反馈和动作数据。其优势在于数据精度极高,能够捕捉细微的触觉反馈,是人形机器人落地的关键。但缺点是成本高昂,需要昂贵的硬件设备和专业场地,且采集效率低。

无本体采集(Agent-based Collection)则允许人类佩戴穿戴设备,在自然环境中记录行为数据,不依赖特定机器人本体。其优势在于成本低、规模可扩展性强,能够快速获取海量泛化数据。觅蜂科技推出的MEgo系列硬件,正是这一路线的代表。创始人姚卯青判断,无本体数据最终价格将收敛至真机数据的1/3至1/2,成为市场的主流补充。

目前,行业呈现出“金字塔”型的数据来源结构。顶层是真机数据,稀缺且昂贵;中层是仿真数据,成本低但存在Sim2Real差距;底层是互联网视频和人类行为数据,来源广泛但需大量清洗。无本体采集填补了中层与底层之间的空白,成为连接人类行为与机器人动作的关键桥梁。

巨头入场与未来展望

随着具身智能赛道升温,互联网大厂也加速入局。京东宣布启动具身智能数据采集中心,计划利用内部员工及外部从业人员,两年内积累1000万小时人类视频数据。百度则推出“具身智能数据超市”,通过层级化标签体系聚合多方数据。这些巨头的入场,将进一步推动数据要素的标准化与规模化。

从2025年11月至2026年7月,包括简智机器人、弈人科技、鹿明机器人等在内的十余家数据相关或具身智能企业完成融资,规模从数千万元至数亿元不等。资本的热情预示着,数据基础设施的建设将成为未来2-3年的投资热点。

然而,产业链的不平等依然显著。底层采集员的时薪并未随行业爆发而大幅上涨,反而面临技术替代的风险。随着计算机视觉和多模态大模型技术的发展,部分简单的动作识别可能由算法自动完成,从而挤压人力采集空间。

对于机器人企业而言,构建自有数据飞轮仍是核心竞争力。单纯购买外部数据只能解决短期问题,唯有通过规模化部署实现数据的持续迭代,才能在长期的具身智能竞争中胜出。

2026年被称为“具身智能数据元年”,这不仅是一个时间点,更是一个信号:数据要素已正式成为具身智能落地的核心驱动力。在这场从虚拟走向实体的智能革命中,掌握数据者,方掌握未来。