具身智能破局:世界模型背后的异构数据经济账与算力困局

0 阅读

技术收敛:从迷雾到端到端的必然路径

人工智能行业的底层逻辑正在经历一场深刻的透明化重构。随着文本大模型逐渐走向成熟与收敛,以及世界模型对DiT(Diffusion Transformer)架构的统一,技术黑盒的光环正在褪去。当前的竞争焦点已不再仅仅是算法的微小迭代,而是转向了对异构数据的极致清洗能力、算法迭代的敏捷速度,以及最为硬核的资金与硬件筹措实力。

2026年,被业界广泛定义为“世界模型元年”。这一节点标志着人工智能从单纯的内容生成,正式跨越至对物理世界的深度理解与实时交互阶段。在WAIC 2026的展会上,具身智能机器人和空间智能设备成为了绝对的焦点。无论是技术极客还是产业资本,都在追问同一个问题:具身智能的“ChatGPT时刻”究竟何时到来?

在这场关于下一代计算范式的竞速中,路线的分歧与收敛正在加速。昆仑万维董事长兼CEO方汉指出,具身智能与世界模型的发展轨迹,完全可以对标自动驾驶技术的演进历程。自动驾驶行业曾经历多种技术路线的激烈角逐,包括模块化架构、规则驱动等,但最终全部收敛到了端到端的FSD(完全自动驾驶)系统上。具身智能世界模型也必将遵循这一规律,走向端到端架构。因为只有这种架构,才能实现真正意义上的规模扩展(Scaling Up),解决长尾场景和泛化性难题。

数据奇点:千万小时定律与成本革命

端到端架构的破局,关键在于跨越数据量的“奇点时刻”。以视频生成模型的发展为例,该领域沉寂多年,直到训练规模达到“20亿个15秒切片”时,才迎来质的飞跃。目前,具身智能行业正处于冲刺百万小时、千万小时数据量的关键阶段。

据行业内部透露,各大头部厂商目前普遍处于10万到20万小时的训练数据积累阶段。这意味着,行业正处于向百万小时乃至千万小时关口发起冲刺的竞速期。预测显示,今年底或许有厂商能达到百万小时级别,而千万小时的拐点极有可能在明年底由头部厂商率先突破。

然而,Scaling Law(缩放定律)虽是真理,但横亘在企业面前的最大挑战是“算账”。在千万小时甚至亿级小时的数据需求面前,传统的具身智能数据采集模式在商业逻辑上似乎已完全失效。方汉为我们算了一笔残酷的经济账:早期数据主要分为UMI数据和真机数据,生产成本极高。仅以基础采集设备为例,单副采集手套成本曾高达十几万元,直至今年才勉强降至一万多元。在此基础上,单位小时的UMI和真机数据采集成本最低需500元,高者甚至达一两千元。

若要生产1000万小时的真机数据,按500元单价计算,至少需要50亿元;若是1亿小时,则需500亿元。这种资本黑洞是绝大多数企业无法承受的。打破这一困境的终极武器,被确认为异构数据(Heterogeneous Data)。

异构数据:低成本与高泛化的双重红利

异构数据的出现,彻底改变了具身智能的数据经济模型。通过手机、胸挂摄像头等日常设备拍摄的人手操作数据,使得采购成本大幅下降。目前,异构数据的采集成本已降至每小时50元左右。方汉预测,从今年到明年,通过视频采集的异构数据成本有望下探至每小时10元。

当成本降至10元一小时,1000万小时的数据仅需1亿元人民币。这一成本门槛使得大规模数据训练成为可能,因此,利用异构数据来扩展具身模型或世界模型,已成为最现实且必然的路径。

除了绝对的成本优势,异构数据在生态多样性与环境复杂度覆盖上,远超昂贵的真机数据。例如,黎曼动力机器人在1.0模型训练中发现,大量异构数据的引入不仅提升了模型的泛化能力,甚至在“叠衣服”这类传统认为仅依赖UMI数据的具体操作上,也带来了显著提升。这表明,异构数据并非廉价替代品,而是提升模型鲁棒性的关键要素。

中国优势:全产业链与场景产能的护城河

在具身智能与世界模型的赛道上,宏观战略的天平正不可逆转地向中国倾斜。这一优势建立在中国不可复制的工业门类全集与庞大的人口基数之上。具身数据的本质是物理世界的操作记录,其采集重度依赖于硬件设备与真实场景的结合。

中国是全球数据采集设备的硬件主产地。与全球厂商卷硬件成本,中国厂商拥有无可比拟的优势。正如汽车雷达行业曾经历的成本雪崩,具身视频采集设备也正在经历类似历程。大量消费电子大厂入局,开发低成本的带运动加速度传感器的双目摄像头,以及更便携、隐蔽的采集穿戴设备,进一步压低了硬件门槛。

更深层次的护城河在于“场景产能”。中国拥有全世界最全的工业门类,意味着工业产品种类最全;同时,服务业高度发达,能够构造出极其丰富的各种操作数据。数据最大的产能地,必然是既具备硬件制造能力,又具备深度场景下潜能力的中国。这种全产业链与场景的结合,构成了中国具身智能独特的竞争优势。

应用陷阱与泛娱乐困局:理性看待AI落地

在大模型商业化探讨中,有一种观点认为底层模型格局已定,重心应全面转向应用层。方汉对此持反对态度。他认为,做应用层同样危险,因为应用能力随时可能被大模型的发展所包含并内化。近期热门的Skills(技能树)便是例证,最新一批文本大模型利用各行业专家编写的Skills进行训练,使得大模型厂商轻易获得了行业最有价值的流程和能力。

对于当前大量创业者试图在垂直行业落地的现状,方汉指出了“拿着锤子找钉子”的逻辑谬误。许多创业者认为自身模型能力强,便到处寻找行业赋能,这种做法充满风险。正确的路径应当是倒推:深入理解行业最真实的需求,然后从需求出发,寻找能满足该需求的模型或AI应用。

在泛娱乐领域,视频生成已成为今年消耗量最大的API。国内某大厂的视频生成收入已占其总收入的一半以上。这种爆发源于门槛降低带来的创作者规模指数级扩张。视频创作者的规模绝不会低于网文作者,满足了海量的长尾需求。

然而,在影视和游戏这两个终极娱乐形态上,AI的渗透步伐因商业规律和物理法则而产生分化。对于AI电影,技术早已不是障碍,爆款AI院线电影和长剧的出现只是时间问题。但对于原生AI游戏,受制于巨大的推理成本鸿沟——游戏世界模型的推理速度必须比传统3D引擎更快——真正的游戏世界模型落地,至少还需要3到5年的时间。这场重塑物理世界交互法则的战役,才刚刚打响,而数据与算力的博弈,将是决定胜负的关键变量。