具身智能:为何“ChatGPT时刻”不会在同一天降临?

0 阅读

在2026年世界人工智能大会的智启具身论坛上,一个核心共识逐渐清晰:具身智能的“ChatGPT时刻”并非像软件发布那样瞬间席卷全球,而是一场分层涌现、节奏各异的长期演进。过去两年,行业致力于证明机器人“能做”;如今,竞争维度已彻底转向机器人能否连续执行数千次任务、在复杂环境中自我恢复,并在部署后实现能力的持续生长。这标志着具身智能正从单一的产品展示,过渡到对训练系统和数据基础设施的深度博弈。

物理AI的“三道墙”与规模化困境

大语言模型的成功建立在明确的Scaling Law之上:更多的数据、更大的模型参数和更强的算力,直接换取更高的智能水平。然而,物理世界并非互联网的简单映射,物理AI面临着三个难以逾越的障碍。

首先是“数据墙”。高质量的真实交互数据极其昂贵且稀缺。互联网上的文本和视频可以被低成本爬取,但机器人与物理世界的每一次接触、每一次试错,都需要真实的硬件参与。其次是“表征墙”。不同任务、场景以及机器人本体之间,尚未形成统一的物理表征标准,导致经验难以直接迁移。最后是“闭环墙”。真实世界中的试错成本极高,一次失败可能导致零部件损坏、人身伤害甚至产线停机,这与大模型生成错误答案的成本有着本质区别。

因此,物理AI规模化的核心不在于单纯的数据量,而在于构建“可执行、可评价、可回流”的交互闭环。大模型擅长回答“做什么”,但机器人必须解决“怎么做”、“力度控制”以及“失败后的应对策略”。将大模型接入机器人并不等于完成具身智能,关键在于如何将数字世界的经验转化为物理世界的执行能力。

数据竞赛:从“数量”转向“配方”与“治理”

随着行业认知的深化,数据积累策略正在发生根本性转变。目前,具身智能的数据结构逐渐呈现出明显的金字塔形态。

金字塔底层是互联网视频和人类行为视频,数据量大、成本低,主要帮助模型理解物体属性、场景布局和人类行为逻辑。中间层则是以第一视角记录、手持或穿戴设备采集的“无本体数据”,这类数据绕开了昂贵机器人的采集瓶颈,提供了丰富的动作轨迹参考。金字塔顶层则是真机遥操作数据、实际部署数据以及失败后的回流数据。虽然数量最少,但这些数据最接近真实执行场景,具有最高的价值密度。

据行业估算,若要实现开箱即用、能理解自然语言指令并在常见任务中达到70%至80%成功率的“ChatGPT时刻”,具身数据可能需要达到亿小时级别。这意味着,仅靠真机采集无法解决问题。未来,数据基础设施的竞争将演变为“配方竞争”——如何混合不同层级、不同来源的数据,以及如何通过治理平台清洗、标注和评测,最终证明这些数据对模型性能的提升效果。

低质量数据的规模化不仅无益,反而有害。一个动作标签的偏差或传感器时间戳的错位,进入训练后都会转化为机器人执行时的误差。因此,数据能否跨本体复用、能否形成真实部署的回流闭环,其重要性远超单纯的数据总量。

路线融合:VLA与世界模型的协同演进

过去,具身智能领域存在关于技术路线的争论:是直接使用视觉-语言-动作模型(VLA)进行端到端输出,还是先建立世界模型预测动作后果,再决定行动策略?从最新的技术进展来看,这两条路线正在走向深度融合。

智元提出的WRAM(世界推理动作模型)就是一个典型代表。它结合了VLA的指令理解能力和世界模型的预测能力,通过“动作思维链”让机器人先进行粗粒度规划,再进行高频精细执行。Physical Intelligence展示的π0.7模型则展示了跨本体迁移的能力,在一种机械臂上训练的技能可以迁移到另一种本体上,无需重新微调。这种跨本体能力的形成,是具身智能走向平台化公司的关键。

如果每更换一种机械臂或夹爪都需要重新采集数据和训练模型,行业将永远停留在传统自动化项目制的低效状态。真正的突破在于建立统一的动作空间,使软件和数据获得规模效应。未来的物理AI系统将是一个多时间尺度的系统:上层处理语言理解和任务规划,中层预测未来状态并制定计划,底层负责高频控制和即时反应。这种分层架构更接近人类大脑、小脑和神经反射系统的协同工作模式。

从“演示惊艳”到“部署可靠”的飞轮效应

具身智能行业长期存在一个误区:过分追求演示视频的视觉效果,而忽视了工业现场的实际需求。成功叠好一次衣服可以制作病毒视频,但工厂关心的是连续工作时的成功率、异常恢复能力以及维护成本。

近期披露的落地数据揭示了这一转变。智元机器人在南昌某3C产线连续作业六天,累计完成近6.5万次操作,成功率高达99.99%;Dyna Robotics的基座模型在餐巾折叠任务中达到99.4%的成功率,并在24小时无人干预下完成850个任务。这些数字表明,行业的评价标准已从单次演示效果转向连续运行时间、任务成功率、适配数据量和人工干预频率。

更深远的意义在于,“研究-部署飞轮”的形成。真实部署不仅是模型训练的终点,更是下一轮训练的起点。部署过程中暴露的长尾问题、失败案例和意外场景,构成了最具价值的训练数据。谁先部署机器人,谁就拥有获取真实数据的时间优势;谁能更快消化这些数据,谁的模型迭代成本就越低。这种数据驱动的迭代循环,将成为具身智能时代的核心竞争力。

分层涌现:为何“ChatGPT时刻”不会同步到来

关于具身智能何时迎来爆发,业内专家给出的时间预测从两年到五年不等。这种差异并非因为判断失误,而是因为物理AI与纯软件产品有着本质不同。

ChatGPT作为纯软件产品,只需服务器就绪即可瞬间触达全球用户。而机器人受限于制造产能、硬件成本、供应链稳定性、安全标准以及现场维护能力,无法通过网页实现全球分发。因此,具身智能的智能涌现必然是分层的、非同步的。

最先成熟的场景将是工厂、仓储、后厨等环境结构化、任务价值明确的领域。这些地方容错率相对较低,但需求刚性,适合验证技术的可靠性。随后,技术将逐步渗透至商超、酒店、养老等半开放环境,这些场景变量增多,对机器人的适应性和安全性提出了更高要求。最后成熟的,将是变量最多、容错要求极高的家庭环境。

在这场竞争中,中国公司的优势在于拥有密集的制造业场景、完整的供应链体系以及快速的工程落地能力。未来的关键在于,能否将这些丰富的场景经验,沉淀为跨本体、跨行业复用的模型能力。当越来越多机器人在真实世界中持续工作,并将每天的成功、失败和意外转化为训练材料时,物理AI的智能涌现将在不同的地点、以不同的速度悄然发生。这或许不是那个万众瞩目的“瞬间”,但却是更坚实、更持久的智能进化之路。