具身智能数据孤岛破局:44亿融资背后,谁在定义“卖数据”的盈利逻辑?

0 阅读

具身智能(Embodied AI)正在经历从算法突破到数据基建的关键转折。随着大模型在认知层面的能力日益成熟,机器人能否真正落地应用,核心瓶颈已转向物理世界的交互数据获取。近期,湖南郴州一家中国移动营业厅挂牌“具身数据采集5S店”的现象级案例,直观地展示了数据获取场景的泛化与平民化趋势。普通用户通过简单的夹爪、手套和头戴相机,即可在日常家务中完成机器人训练数据的采集。这种看似轻量的创新背后,折射出的是整个行业对高质量物理交互数据的极度渴求。据初步估算,首期投放的1000套设备在满产状态下,每年即可产出100万小时的数据,这种“边做家务边搞科研”的模式,不仅解决了数据供给问题,更成为了一种极具传播力的营销手段。

展示机器人、数据图表和分析界面的等距风格示意图,常用于表现人

然而,表象的热闹掩盖不了底层的技术难题。具身数据采集并非简单的动作记录,而是需要高精度的多模态数据同步。目前,行业内围绕数据获取形成了四条主要技术路线:真机遥操、无本体采集、仿真合成以及互联网视频蒸馏。这四条路线各有优劣,且呈现出明显的交叉融合趋势。在已统计的70家数据采集公司中,有43%的玩家选择跨路线布局,这表明单一技术路线已无法满足机器人训练对数据多样性、真实性和安全性的综合需求。其中,真机遥操因能直接获取最真实的物理反馈,成为最拥挤的赛道,吸引了22家独立玩家,包括大量国资背景的数据平台。国资平台凭借“不怕重”的资源调度能力,在需要大量硬件投入和场地支持的遥操模式中占据优势。

展示70家具身数采公司技术路线分布的统计信息图,包含真机遥操

相比之下,无本体采集路线虽然门槛较低,通过动捕、Ego视角相机甚至肌电(sEMG)信号直接映射人类动作,但其技术复杂度极高,且对传感器精度要求严苛。这条赛道吸引了大量2024年后成立的新兴公司,显示出极强的创新活力。仿真合成路线曾被视为解决数据稀缺的“银弹”,但随着Sim2Real(仿真到现实)差距难以彻底弥合,以及真实数据成本的快速下降,其相对优势正在被削弱。光轮智能、银河通用等早期专注仿真的巨头,纷纷转向真机遥操或混合模式,反映了行业对高保真物理反馈的重新重视。而互联网视频蒸馏路线,如枢途科技所代表的方向,试图以极低的成本从公开视频中提取知识,虽极具想象力,但在精细化动作控制上的应用仍面临挑战。

一张展示机器人数据服务商分类统计的示意图,包含独立数据服务商

从玩家构成来看,具身数据行业已演变为一个多层次、多背景的生态体系。97家核心玩家中,独立数据服务商占比最高,达到40%,这一现象标志着数据服务已从机器人本体制造或模型训练中剥离,成为一条独立的垂直赛道。值得注意的是,67%的玩家为“具身原生”企业,意味着大量创业者是在具身智能概念兴起后直接切入该领域;而数据基础设施(Data Infra)领域则更多由传统AI数据标注、自动驾驶或工业软件公司跨界转型而来。这种结构差异源于两个领域的本质不同:数据采集需要从零构建资产和流程,新玩家没有历史包袱,更容易轻装上阵;而数据基础设施需要成熟的管线、质检和交付能力,这正是传统数据标注公司的核心优势。

一张展示机器人正在使用键盘处理数据的科技风格插画,适合用作人

产能与需求的巨大落差,是驱动资本涌入的核心动力。目前行业年产能约为160万至180万小时,而短期目标旨在未来1-3年内提升至2500万至3500万小时,这意味着产能需要扩张15到20倍。即便实现这一目标,与语言大模型所消耗的互联网语料规模相比,具身数据仍处在“刚够起跑线”的阶段。全球高质量真实物理交互数据总量仅约50万小时,这一数字相对于万亿参数的具身大模型而言,显得杯水车薪。这种供需失衡不仅体现在数量上,更体现在质量上——如何从海量粗糙数据中筛选出高价值样本,如何确保数据的安全性与合规性,都是亟待解决的行业痛点。

一张展示机器人行业公司梯队分布、融资情况及数量的数据表格图

资本市场的反应为行业现状提供了最诚实的注脚。过去一年,15家独立的具身数据服务商共融资约44.7亿元。这一数字在具身智能整体438亿元的半年融资额中占比不高,反映出资本对纯数据生意的谨慎态度。数据业务本质上属于“劳动力密集型”,随着技术进步和规模化效应,价格必然呈下降趋势,天花板相对清晰。相比之下,具身“大脑”(模型层)和“小脑”(控制层)因其想象空间的巨大,更容易获得高估值。

在15家融资企业中,梯队分化现象极其明显。光轮智能以31亿元的融资额独占鳌头,估值突破20亿美元,成为全球首家具身数据独角兽,展现了头部效应的马太效应。第二梯队11家公司累计融资数千万至数亿元,多处于Pre-A轮阶段,显示出行业仍处于早期探索期。第三梯队3家公司融资仅在数千万元级别,业务尚处验证阶段。更值得关注的是,69家投资机构中,没有一家进行重仓连续加注,多数机构仅进行一次试探性投资。这种“撒网式”的投资策略,表明资本尚未形成对标的公司的共识,仍在等待商业模式的清晰化。

展示投资机构出手次数、数量及代表机构的统计表格截图

尽管面临挑战,具身数据行业的潜力不容小觑。首先,数据要素具有全球流通的潜力,国外市场的需求同样旺盛。其次,数据采集能力可以向上迁移至模型评测、仿真测试等环节,成为物理AI的基础设施。目前,全国已有20个省份建有数采工厂,长三角地区分布最为密集,无锡等地更是提出“城市全域数据采集”概念,鼓励制造业和服务业开放真实场景作为数据工厂。这种政企合作模式,有望加速数据资源的沉淀与转化。

展示全国数采工厂地域分布的统计表格图,包含区域、数量、占比及

展望未来,具身数据行业将在未来1-2年内进入关键的验证窗口期。行业将从单纯的“数据收集”转向“数据价值挖掘”,重点解决数据标准化、清洗效率及版权合规等问题。对于玩家而言,单纯依靠“卖数据”的线性商业模式难以为继,必须向数据服务、模型微调辅助、仿真环境构建等增值方向拓展。国资平台、技术型初创公司与跨界转型企业将在不同细分领域形成互补,共同构建具身智能的数据底座。

一张展示数据中心、服务器维护、自动化运维及人机协作的等距风格

总而言之,具身数据采集行业正处于从“野蛮生长”向“规范发展”过渡的关键时期。虽然当前商业模式尚未完全跑通,但作为具身智能落地的必经之路,其战略价值日益凸显。随着技术路线的收敛和产能规模的扩大,具备核心技术壁垒、独特数据场景资源以及高效数据处理能力的企业,有望在激烈的行业竞争中脱颖而出,真正实现从“数据矿工”到“数据银行家”的角色转变。这一过程不仅将重塑机器人产业的价值链,也将为人工智能从数字世界迈向物理世界提供坚实的数据支撑。

一张展示未来科技场景的插画,画面中有人形机器人正在操作全息数

一张展示人形机器人、神经网络球体和数据图表的复古风格科技插画