具身智能数据荒破局:百亿融资背后,卖数据真能成赚钱生意吗?
物理世界的“数字粮仓”:具身数据的爆发与困境
在湖南郴州的一家中国移动营业厅里,发生着一种略带荒诞却又极具时代特征的景象。普通顾客只需领取一套包含夹爪、手套和头戴相机的设备,经过简短培训,就能在演示家务劳动的过程中,不知不觉地为机器人训练采集数据。这种将数据采集融入日常生活的“5S店”模式,只是具身智能领域无数创新尝试的一个缩影。从免费上门保洁换取家庭场景数据,到通过VR游戏化操作进行远程采集,再到接入互联网进行“云操控”,行业内的“花活”层出不穷。
这些看似有趣的尝试背后,掩盖不了一个严峻的行业现实:机器人太缺数据了。与大型语言模型(LLM)可以轻易消费互联网上海量的文本语料不同,具身智能所需的物理交互数据必须一条条、一帧帧地采集。据不完全统计,截至2026年初,全球高质量真实物理交互数据的总量仅约为50万小时,这还不到LLM训练数据量的两万分之一。巨大的供需缺口,迫使行业加速探索多样化的数据采集路径,并催生了一个新的独立赛道——具身数据服务。
技术路线之争:四大范式与跨路线融合
目前,具身数据采集技术主要演化为四大类路线,每一类都有其独特的适用场景与局限性。首先是真机遥操,即人类操作员操控真实机器人执行任务,同步记录动作、状态及传感器数据。其次是无本体采集,人直接完成示范,通过动作捕捉、肌电传感、第一视角相机等设备采集人类动作,无需机器人本体参与。第三类是仿真合成,在虚拟环境中批量生成交互数据,主要用于模型预训练。最后则是互联网视频蒸馏,从现有的互联网视频中提取人类动作知识,转化为机器人可学习的数据。
在这四条路线中,跨路线采集成为了主流趋势。在统计的70家数据采集公司中,有43%同时采用多条技术路线。这种“不把鸡蛋放在同一个篮子里”的策略,源于没有任何单一方法能完美满足机器人训练的全部需求。例如,真机遥操能获取最真实的物理反馈,但成本高昂且扩展性差;仿真合成效率高,但存在“Sim2Real Gap”,难以高保真还原摩擦、形变和触觉反馈;而互联网视频蒸馏虽然成本极低,但数据噪声大且缺乏精确的物理状态信息。
具体来看,单独押注真机遥操的玩家最多,占比31%,其中不乏国资背景的平台和机器人本体厂商。国资平台凭借资金优势能够承担重资产投入,而机器人公司则拥有硬件闭环的天然优势。相对而言,单独押注仿真或视频蒸馏的厂商较少,这反映了行业对数据真实性的迫切需求。随着真机数据和人类数据供给增加、价格下降,纯仿真派的压力越来越大,迫使如光轮智能、银河通用等曾以仿真为核心的巨头转向多路线布局。
玩家图谱:独立服务商崛起与跨界融合
从玩家身份来看,具身数据行业已形成清晰的梯队分布。在97家国内主要玩家中,独立数据服务商占比最高,达到40%。这一现象标志着具身数据已从机器人公司的附属部门,成长为一条具备独立商业价值的赛道。
进一步分析玩家的背景,可以发现“具身原生”与“跨界转型”并存的格局。67%的玩家是“具身原生”公司,它们从成立之初就聚焦于具身智能相关业务。而33%的玩家则来自AI数据标注、自动驾驶、动作捕捉或工业制造领域的跨界转型。值得注意的是,这种分布在不同细分领域表现迥异:数据采集环节由于需要从构建资产做起,新玩家反而具有轻装上阵的优势;而数据基础设施(Infra)环节,如数据清洗、质检、标注管线等,则吸引了大量拥有相关经验的老玩家转型进入。
这种结构差异也影响了行业的创新节奏。具身原生公司更擅长探索新的采集技术和场景,而跨界转型公司则致力于提升数据处理的效率和标准化程度。两者共同推动了行业从粗放采集向精细化、基础设施化方向发展。
产能瓶颈与地域布局:从长三角到全国铺开
尽管需求巨大,但当前的数据产能仍显捉襟见肘。据统计,目前具身数据行业的年产能约为160万至180万小时,加上数千万条独立数据。行业的短期目标是未来1至3年内将产出提升至2500万至3500万小时。这意味着产能需要扩大15到20倍,且这一目标仅涵盖真机遥操和无本体采集数据,未包含仿真数据。
这种巨大的产能缺口,在地理分布上也有所体现。全国的数采工厂已覆盖20个省份,其中长三角地区以30座位居首位,京津冀和珠三角紧随其后。有趣的是,随着遥操技术的成熟和成本考虑,越来越多的三、四线城市如宿迁、自贡、郴州等也成为数采工厂的选址地。无锡更是提出了“城市全域数据采集”的概念,鼓励制造业和服务业企业开放真实场景作为采集厂。这种分布模式既反映了技术路线对成本的不同敏感度,也体现了地方政府将具身数据视为新质生产力重要组成部分的战略意图。
资本热潮下的冷静:44.7亿融资与梯队分化
在2026年上半年具身智能全行业融资约438亿元的宏大背景下,具身数据赛道的表现显得相对冷静。统计显示,15家独立具身数据服务商在过去一年内共完成34起融资,总额约44.7亿元。这一数字虽不小,但相较于“大脑派”公司的火热,仍处于次要地位。
深入分析这15家公司的融资情况,可以发现明显的梯队分化。第一梯队由光轮智能领衔,其过去一年完成6起融资,总额达31亿元,占总融资额的七成,估值超20亿美元,成为全球首家具身数据独角兽。第二梯队包括简智机器人、诺亦腾机器人等11家公司,累计融资在数千万至数亿元不等,大多处于Pre-A轮或A轮阶段。第三梯队则由枢途科技等3家公司组成,处于天使轮及早期验证阶段。
这种分化背后,是资本市场对数据商业模式的审慎评估。尽管有69家投资机构出手,但极少有机构重仓押注。多数机构仅参与一两笔投资,显示出对赛道标的共识尚未完全形成。投资人担心,数据服务本质上仍是“劳动力密集型”生意,随着产能释放,价格竞争将不可避免,天花板相对明确。然而,也有乐观观点认为,具身数据具备全球市场潜力,且数据采集能力可迁移至模型评测,有望成为物理AI的基础设施。
商业验证:从“卖数据”到“卖服务”的转型
行业仍处早期,商业模式尚未完全验证。在15家受访公司中,仅有一家公司自称盈利,且未公开具体数据。这意味着,“纯卖数据”是否是一门可持续的赚钱生意,仍是悬而未决的问题。
面对价格下行压力和产能扩张需求,行业正在探索从单纯的数据采集向数据服务转型。一方面,通过自动化采集工具和AI辅助标注降低人力成本;另一方面,拓展数据应用边界,如提供数据质量评估、模型微调服务、场景化解决方案等。此外,跨境数据合作也成为新的增长点,国外市场对高质量具身数据的需求同样旺盛,为国内服务商提供了广阔的想象空间。
展望未来一两年,将是具身数据商业模式的关键验证期。产能能否如期兑现、价格战是否会导致行业洗牌、谁能率先拿出利润表,将决定哪些企业能成为真正的“卖铲人”。在这个过程中,那些能够平衡技术创新与成本控制、构建数据护城河并拓展多元服务价值的玩家,更有可能在激烈的竞争中脱颖而出。
具身智能的下半场,不仅是算法和硬件的竞争,更是数据质量和规模的较量。当数据成为物理世界的“石油”,谁能高效开采、精炼并交付,谁就能掌握通往通用人工智能的关键钥匙。尽管前路充满不确定性,但这一赛道的独立化、基础设施化趋势已不可逆转,它正在重塑AI产业的底层逻辑,并为全球经济注入新的活力。