具身智能数据融资44.7亿:独立数据商如何突破“卖铲人”盈利困局?

4 阅读

在人工智能的宏大叙事中,具身智能(Embodied AI)被视为继大语言模型之后的下一个核心风口。然而,当聚光灯聚焦于“大脑”——即具身大模型时,一个更为底层且关键的要素往往被忽视,那就是“数据”。正如自动驾驶依赖海量行车数据一样,机器人的进化同样受限于物理交互数据的匮乏。近期,一份详尽的行业梳理揭示了具身数据赛道的真实图景:近百家玩家入场,独立数据服务商在过去一年融资约44.7亿元,但行业仍处在黎明前的混沌期。

数据采集的技术博弈:没有万能钥匙

具身智能数据的生产并非简单的“记录与回放”,其技术路线呈现出高度复杂化和多元化的特征。目前主流的数据采集技术可划分为四大类,每种路径都有其独特的优劣势与适用场景。

第一类是真机遥操(Teleoperation)。这是目前最接近人类真实操作习惯的方式,通过人类操作员操控真实机器人执行任务,同步采集动作、关节状态及多模态传感器数据。这种方式的优点是数据真实性极高,缺点是重资产、高人力成本,且难以大规模并行。

第二类是无本体采集(No-Robot)。这种方式绕过了昂贵的机器人本体,直接由人类完成示范动作,利用动捕系统、肌电传感器或第一视角相机采集数据。其优势在于轻量化和低成本,适合快速积累基础动作库,但难点在于如何将人类动作精准映射到不同形态的机器人上,存在“Sim2Real”的鸿沟挑战。

第三类是仿真合成(Simulation)。在虚拟环境中批量生成机器人交互数据。虽然成本极低且能无限扩展场景,但其核心痛点在于高保真度难题。现实世界中的摩擦、形变、力觉反馈等物理特性极难在仿真中完美还原,导致纯仿真数据往往难以直接用于高精度控制。

第四类是互联网视频蒸馏(Video Distillation)。这一新兴路线试图从海量互联网视频中提取人类动作知识。虽然潜力巨大且成本极低,但如何从二维视频中解耦出三维空间信息并转化为可控指令,仍是技术上的巨大挑战。

值得注意的是,行业内43%的玩家选择跨路线采集,这表明单一技术路线已无法满足机器人训练的多元化需求。数据金字塔结构决定了机器人需要从低级动作到高维认知的全栈数据,任何单一手段都显得捉襟见肘。

玩家图谱:独立服务商崛起与梯队分化

若按身份分类,具身数据行业的玩家格局呈现出鲜明的“去附属化”特征。统计显示,独立数据服务商已成为最大的玩家群体,占比达40%。这意味着具身数据已从机器人公司的内部支撑部门,演变为一条独立的产业链条。

在这近百家玩家中,约67%为“具身原生”公司,而数据基础设施(Infra)领域则有70%的玩家来自“跨界转型”,如传统的AI数据标注公司、自动驾驶公司或工业制造企业。这种分化背后的逻辑在于:数据采集需要从零构建资产,新玩家轻装上阵;而数据基础设施需要成熟的管线、质检和交付能力,这正是传统标注公司的核心优势。

进一步深入资本视角,15家代表性独立数据服务商形成了明显的三级梯队。第一梯队由光轮智能领衔,其过去一年融资31亿元,估值超20亿美元,成为全球首个具身数据独角兽。这种头部效应表明,具备全栈数据采集能力和规模效应的玩家正在获得资本的高度溢价。

第二梯队由11家公司组成,累计融资在数千万至数亿元之间,多处于Pre-A轮及以前。第三梯队则仅有3家公司,融资规模在数千万元级别,尚处于早期验证阶段。值得注意的是,虽然赛道热度上升,但与具身智能全行业半年438亿元的融资总额相比,数据赛道的44.7亿元显得“不够性感”。这反映出资本市场虽然看好方向,但对数据商“劳动力密集型”的本质仍保持谨慎,尚未出现敢于重仓的单点共识标的。

产能困境:巨大的供需缺口与地域分布

尽管资本入局,但具身数据的产能与需求之间存在着巨大的鸿沟。目前,全行业年产能保守估计为160万至180万小时真机/无本体数据,以及7000万至8000万条数据。然而,行业的短期目标是未来1-3年内达到2500万至3500万小时。这意味着产能需扩大15到20倍。

更严峻的是,与LLM可以消耗整个互联网语料不同,机器人需要的是高质量、真实的物理交互数据。截至2026年初,全球高质量真实物理交互数据总量仅约50万小时,不足LLM训练数据量的两万分之一。即便产能目标全部兑现,相比庞大的训练需求,仍可能仅刚够到起跑线。

从地域分布来看,全国20个省份已建有数采工厂,其中国家资背景的覆盖16个省份。长三角地区以30座数采工厂居首,其次是京津冀和珠三角。值得注意的是,为了降低人力成本,宿迁、自贡、郴州等三四线城市也成为了数采工厂的新兴选址地。这种分布模式与技术路线密切相关:遥操类工厂散布各省以利用本地人力,而轻资产的无本体路线公司则多扎堆于一线城市以获取技术人才。

盈利谜题:谁在真正赚钱?

尽管融资火热,但具身数据行业的商业模式仍处于早期的“黑盒”状态。在被统计的15家独立数据服务商中,没有一家公开披露过利润,仅有弈人科技自称盈利但未公开具体数字。这种“只烧钱、难赚钱”的现状,揭示了数据作为产品的特殊属性。

数据并非标准品,其价值取决于场景、质量和标注精度。随着技术门槛的降低和竞争者的涌入,数据单价面临持续下降的压力。此外,数据采集本质上是“劳动力密集型”生意,边际成本递减效应不如软件产品明显。投资人担忧的“价格战”和“天花板限制”并非空穴来风。

然而,这并不意味着该赛道没有未来。数据的延展性想象空间在于其可作为物理AI的基础设施,延伸至模型评测、仿真验证等领域。更重要的是,这是一个全球性市场,国内成熟的采集能力若能输出海外,将打开新的增长极。

未来展望:验证窗口的到来

具身数据行业正处于从“技术探索”向“商业验证”过渡的关键节点。未来一到两年将是决定生死的核心窗口期。

首先,标准化将成为关键。目前行业内缺乏统一的“小时”与“条数”换算标准,这阻碍了数据的流通与定价。建立行业通用的数据质量评估体系和交换标准,是提升效率的前提。

其次,自动化与智能化采集是降本的核心。单纯依赖人工遥操难以满足指数级增长的需求。利用大模型辅助数据清洗、仿真数据增强、以及更高效的无本体采集技术,将是降低单位数据成本的关键路径。

最后,生态位的重新定义。独立数据服务商不能仅做“卖数据”的初级供应商,而应向“数据+标注+质检+部分评测”的全链路服务商转型,提升客户粘性和单客价值。

资本的态度虽然谨慎,但并未离场。当首批玩家拿出亮眼的利润表,当数据价格战找到平衡点,当标准化流程普及,具身数据赛道有望从“噪音”走向“信号”。对于从业者而言,这不仅是技术的竞争,更是对规模化运营能力和成本控制能力的极致考验。在这场马拉松中,唯有那些能率先实现商业化闭环、并建立起数据护城河的玩家,才能最终胜出。