具身智能数据狂飙:44亿融资背后,谁能跑通“卖数据”盈利闭环?
在湖南郴州的一家普通中国移动营业厅里,挂起了“具身数据采集5S店”的招牌。这看似是一次普通的线下营销创新,实则折射出具身智能行业对数据极度渴求的焦虑。普通顾客只需领取夹爪、手套和头戴相机,经过短暂培训,在居家环境中完成的动作即可转化为机器人训练所需的珍贵数据。这种将数据采集嵌入日常生活的模式,仅是行业无数“花活”中的冰山一角。从免费上门保洁换取访问权限,到开发VR游戏让用户在游戏中完成操作示范,再到远程“云操控”机器人,这些创新手段的背后,是一个正在快速膨胀却尚未成熟的百亿级市场。
随着2025年至2026年行业的爆发,量子位统计显示国内已有97家具身数据玩家,其中70家专注于数据采集,27家提供数据基础设施服务。在过去一年中,15家“不做本体、不做模型、只做数据”的独立具身数据服务商,共完成了约44.7亿元人民币的融资。尽管这一数字相较于具身智能“大脑派”公司半年223亿元的融资额显得 скромно,但它标志着一个独立赛道的正式确立。然而,在资本狂热与焦虑并存的市场中,真正的核心问题在于:谁能真正通过“卖数据”实现盈利?
数据采集技术路线的博弈与融合
目前,具身数据采集的技术路线主要划分为四大类,且呈现出明显的跨界融合趋势。第一类是真机遥操,即人类操控真实机器人执行任务,同步采集动作、状态及传感器数据。这类路线重资产、高成本,但数据质量最高,特别适合复杂的物理交互场景。第二类是无本体采集,通过动捕、夹爪映射或第一视角相机直接采集人类动作,无需机器人硬件参与,具有轻量化、低成本的优势,但存在Sim2Real(仿真到现实)的迁移难题。第三类是仿真合成,在虚拟环境中批量生成数据,虽能解决数据稀缺问题,但难以高保真还原摩擦力、形变和触觉反馈。第四类是互联网视频蒸馏,从互联网视频中提取知识,成本极低但信息密度有限。
数据显示,在70家数采公司中,有43%的玩家采取跨路线采集方案。没有任何单一技术路线能满足机器人训练的全部需求,因此“组合拳”成为行业共识。单独押注真机遥操的公司最多,共22家,其中13家为国资数据平台,7家为机器人公司。国资平台凭借资金和场地优势,能够承担遥操路线的重资产投入;而机器人公司则利用自身硬件优势,构建从采集到应用的闭环。相比之下,单独押注仿真合成的玩家极少,仅存2家,因为光轮智能、银河通用等曾坚定的仿真派,如今均转向采集真实人类数据,以弥补仿真数据在物理真实性上的不足。
玩家画像:从具身原生到跨界转型
若按玩家身份分类,独立数据服务商以39家占比40%成为最大群体,这标志着具身数据已脱离机器人公司的附属部门地位,成长为独立赛道。国资数据平台占据26%,机器人公司占据25%,工业和IT跨界公司占5%,大厂平台型公司占4%。这种多元化的玩家结构反映了不同背景企业对数据价值的不同理解。
进一步分析发现,67%的玩家为“具身原生”公司,33%为“跨界转型”公司。这种分布在新旧玩家的界限中呈现出有趣的反差:70家数采公司中,八成是具身原生公司,而27家数据基础设施公司中,七成来自跨界转型。AI数据标注公司如海天瑞声、数据堂等,凭借其在数据管线、质检和交付方面的积累,顺利切入数据基础设施环节。而数据采集需要从零构建资产,新玩家在轻装上阵方面具有天然优势,这使得具身原生公司成为采集环节的主力军。
产能缺口与地理分布的不均衡
产能缺口是行业面临的最大现实挑战。目前,具身数据行业年产能约为160万至180万小时,以及7000万至8000万条数据。相比之下,行业的短期目标是未来1-3年内产出2500万至3500万小时数据,这意味着产能需扩大15到20倍。即便这一目标全部兑现,相比大语言模型(LLM)训练所需的庞大数据量,仍只是刚够到起跑线。全球高质量真实物理交互数据总量仅约50万小时,不足LLM训练数据量的两万分之一。这种巨大的供需鸿沟,决定了数据采集在未来数年内将持续处于卖方市场。
从地理分布来看,全国20个省份已建有数采工厂,其中国家资背景的覆盖16个省份。长三角地区以30座居首,其次是京津冀和珠三角。值得注意的是,宿迁、自贡、郴州等三四线城市因人力成本较低,也成为数采工厂的选址热点。无锡甚至提出“城市全域数据采集”概念,鼓励制造业和服务业开放产线,将真实场景转化为采集厂。这种分布模式与采集路线密切相关:遥操类工厂散布各省,而轻资产的无本体路线公司则更倾向于扎堆一线城市。
资本态度:谨慎撒网与梯队分化
在资本层面,44.7亿元的融资总额呈现出明显的梯队分化。第一梯队的光轮智能最为突出,过去一年完成6起融资,共计31亿元,占总融资额的七成,估值超20亿美元,成为全球首个具身数据独角兽。第二梯队包括简智机器人、诺亦腾机器人等11家公司,累计融资在数千万至数亿元间,多处于Pre-A轮及以前。第三梯队则有3家公司,融资在数千万元级别,处于天使轮早期验证阶段。
尽管赛道火热,但资本的谨慎态度显而易见。过去一年,69家投资机构出手这15家独立服务商,但仅有3家机构出手3次,5家机构出手2次,其余63家均只投了1次。相比具身模型融资时头部机构连续加注的景象,数据赛道尚未形成“共识标的”。这种谨慎源于两个核心担忧:一是数据业务本质上是“劳动力密集型”,价格战不可避免,利润空间会被不断压缩;二是数据需求虽有预期,但天花板明确,想象空间远小于具身模型。
然而,也有投资人看好其延展空间。一方面,具身数据是全球性生意,海外市场潜力巨大;另一方面,数据采集能力可迁移至模型评测等领域,成为物理AI的基础设施。但无论如何,目前尚无一家公司公开披露过利润,仅弈人科技自称盈利但未公开具体数字。这表明,“纯卖数据”的商业模式仍处于早期验证阶段。
盈利闭环的未来验证
具身数据行业已成长为AI领域新增就业岗位的蓄水池和地方经济活力的新引擎,但其核心问题仍未解决:如何从“卖数据”走向“赚钱”。行业目前处于早期阶段,数据标准缺失、变现模式单一、技术路线未定等变量尚未收敛。未来1-2年将是关键的验证窗口期。
在这个过程中,产能的兑现能力、价格战的底线以及谁的利润表率先公开,将决定最终胜者。对于独立数据服务商而言,单纯的“数据采集”可能难以支撑高估值,唯有构建起从采集、清洗、标注到评测的全链路基础设施,并形成可规模化的自动化管线,才能摆脱“人力密集”的低效陷阱。同时,跨界融合与国际化拓展可能是打破天花板的关键路径。对于投资者而言,在狂热中保持理性,在分散中寻找具有技术壁垒和规模化能力的标的,将是获取超额收益的关键。具身智能的“卖铲人”故事,才刚刚开始书写,而真正的赢家,必将属于那些能解决物理世界数据最后一公里难题的企业。