时薪30元折叠衣物,数据估值150亿:具身智能背后的隐秘淘金链
在2026年的科技版图中,具身智能正从实验室走向商业化深水区。然而,在光鲜亮丽的机器人发布会背后,一条隐秘而庞大的数据供应链正在野蛮生长。这条链条的一端,是数以万计的普通劳动者,他们在居家客厅或嘈杂工厂中,日复一日地演示叠衣服、系鞋带、开柜门等琐碎动作;另一端,则是估值飙升、融资不断的“卖水人”,他们不制造机器人,却通过贩卖数据获得了比整机厂商更高的估值溢价。这种巨大的反差,揭示了具身智能时代一个残酷而真实的商业逻辑:数据,正在成为比硬件更稀缺的战略资源。
微观视角:作为“生物燃料”的采集员
对于张月这样的居家数据采集员来说,她的工作并非简单的家务劳动,而是一场精密的身体数据采集工程。每天早晨8点打卡开始,她需要佩戴5个摄像头或一台运动相机,在镜头的严密监控下,模仿机器人的运动轨迹完成系鞋带、扫地等指令。在苏州,她的日薪约为250元,折合时薪30元。但这笔收入背后,是极高的身体约束和设备依赖。
采集过程充满了技术性的摩擦成本。穿戴设备本身是一项耗时巨大的工程,张月每次穿戴需要花费半小时调试角度,期间严禁抓挠或随意脱卸。更令人头疼的是设备的“玄学”故障:录着录着突然关机、传感器失灵、主机过热、U盘读取失败,甚至镜头角度偏移而不自知。在居家场景下,有效采集时长要求高达8小时,这意味着即便设备频频“罢工”,采集员也必须在这有限的时间内拼命追赶进度,以确保数据的连续性和完整性。
相比之下,室外场景的王雷则面临另一种挑战。虽然日薪相同,但他需要频繁更换地点,从距家300米的超市到10公里外的汽修厂,场景切换由业务员统筹。尽管有巡检人员负责设备调试,但数据采集员的核心任务依然单一:在特定场景下重复人类动作。这些由人类演示的动作数据,经过中介封装,最终流向全国各地的机器人研发公司,成为训练AI识别和操作技能的原始素材。
在更专业的数采中心,像小陈这样的“真机遥操作员”则坐在桌前,通过VR设备操控机械臂完成物品抓取、投掷等指令。尽管夜班日薪可达370元,看似轻松,但实际上工作强度极大。这是一个对年龄和耐心有隐形门槛的行业,入职第一天往往有70%的人因无法忍受枯燥而离职。小陈们签订的通常是外包合同,工作稳定性极低,项目间歇期可能长达一周。然而,对于许多年轻人而言,这仍是当前就业市场中一种相对自由的收入来源。
中观架构:金字塔形的数据供应链
这些微观层面的个体劳动,汇聚成了一个供需极度失衡的宏观市场。据行业测算,训练一个接近人类水平的人类级机器人“大脑”,需要10亿小时级别的真实操作数据。然而,目前全球的有效供给仅约500万小时,缺口高达200倍。这种严重的供不应求,直接推高了数据的定价权,使得2026年被业内称为“具身智能数据元年”。
目前,具身智能的数据来源呈现出鲜明的金字塔结构,不同层级的数据在成本、质量和应用场景上存在巨大差异。
处于金字塔顶层的是“真机数据”。这是通过VR、外骨骼等设备操控真实机器人,精确记录其动作和力反馈数据。虽然数据质量最高,直接决定了人形机器人的落地精度,但其采集成本极其高昂,市场价高达500-1000元/小时。这类数据通常由大型互联网厂商或头部机器人公司自有团队采集,如智元机器人孵化的觅蜂科技,正在积极构建千万小时级的真机数据产能。
处于中层的是“仿真数据”。通过在虚拟环境中批量生成机器人交互数据,仿真数据具有成本低、可规模化生成的优势,能够有效弥补真机数据的不足。然而,仿真数据缺乏真实世界的物理噪声和复杂性,往往需要结合真实数据进行微调(Sim-to-Real)才能落地。
处于金字塔底层的是“互联网视频与人类行为数据”,这也是张月、王雷等采集员所贡献的数据类型。这类数据被称为“无本体采集”数据,即由人类佩戴设备演示动作,而非操控机器人。其来源广泛、泛化性强,虽然精度不如真机数据,但成本极低,仅需30-50元/小时(含中间商溢价)。随着行业对泛化能力要求的提升,这类底层数据的重要性日益凸显。
宏观博弈:谁在赚取超额利润?
在这场数据淘金潮中,最显著的特征是产业链价值的向上游集中。基层采集员的时薪不仅没有随着行业热度上涨,反而因劳动力供给充足而维持在低位。相反,位于产业链中上游的数据服务商,却享受着超额利润和资本市场的狂热追捧。
以光轮智能为例,这家成立于2023年的独立数据服务商,目前估值已超150亿元。其商业模式的精髓在于“数据复售”。通过采购标准化的底层数据,经过清洗、标注和结构化处理后,形成高质量的数据产品,同时卖给智元、银河通用等多家头部机器人公司。由于数据一旦采集并清洗完成,边际复制成本几乎为零,光轮智能实现了超过10倍的数据复售率。2026年第一季度,其新增订单达5.5亿元,超过了2025年全年的总和。这种“一次采集,无限变现”的模式,使其盈利能力远超许多处于烧钱阶段的机器人本体制造商。
除了独立数据服务商,头部机器人公司也在通过内部孵化或战略投资切入数据领域。觅蜂科技的创始人姚卯青指出,当前数据需求方普遍处于“饥渴”状态,需求往往具有即时性。为此,觅蜂科技推出了MEgo系列无本体采集硬件,采取“卖铲子+产数据”的双线模式,既销售硬件设备给其他采集方,又通过自有网络产出数据。这种策略不仅规避了真机采集的高成本,还通过硬件销售获得了额外的现金流。
甚至冲击IPO的宇树科技,也在招股书中坦言,前期研发侧重本体与运动控制,而在“大脑”层面的数据采集投入较少。为了弥补这一短板,宇树计划将募资中近一半的20.22亿元投入智能机器人模型研发,核心任务即是“搭建大规模真实数据集”。这一举动进一步印证了数据在具身智能时代的战略核心地位:没有足够的高质量数据,再精良的硬件也无法赋予机器人真正的智慧。
互联网大厂同样在加速布局。京东宣布启动具身智能数据采集中心,计划利用内部数十万员工及外部从业人员,在两年内积累千万小时人类视频数据。百度则推出“具身智能数据超市”,试图通过层级化的数据标签体系,聚合多方数据资源,建立行业标准。
行业反思:泡沫与机遇并存
在这场围绕具身数据的狂欢中,我们必须保持冷静的观察。一方面,数据确实已成为具身智能落地的瓶颈所在,解决“数据荒”是行业发展的当务之急。另一方面,当前的估值泡沫也值得警惕。虽然数据服务商目前的财务表现亮眼,但随着无本体采集技术的标准化和普及,底层数据的定价权可能会逐渐向真机数据收敛。觅蜂科技曾预判,未来无本体数据的价格可能稳定在真机数据的三分之一到二分之一,即300-400元/小时。如果这一趋势成真,单纯依靠数据倒卖的低门槛服务商将面临巨大的利润挤压。
此外,数据隐私、伦理问题以及版权归属,也是这条隐秘产业链必须面对的合规挑战。随着采集规模的扩大,如何在保障数据供给的同时,保护个人隐私和劳动权益,将是行业可持续发展的关键。
总体而言,具身智能的数据产业链正在经历从“粗放采集”向“精细化运营”的转型。基层采集员的廉价劳动力红利正在消失,取而代之的是对数据质量、标注精度和场景丰富度的更高要求。对于投资者和企业而言,关注那些拥有独特场景数据、高效数据处理算法以及合规运营能力的头部玩家,或许比追逐短期的估值泡沫更为重要。在这场漫长的淘金期中,数据不仅是机器人的燃料,更是决定谁能最终跑通商业化闭环的关键变量。