RSS 2026现场洞察:中国具身智能何必做“美国版XX”?

0 阅读

学术与产业的“时差”:VLA依然是主角

刚抵达悉尼参加机器人学顶级会议RSS 2026时,一个显著的现象引发了现场参会者的疑惑:为何在国内,"世界模型取代VLA"的论调已流行数月,甚至被视为具身智能的新范式,但在机器人学的最高学术殿堂,VLA(Vision-Language-Action)相关报告依然占据主导地位?

这种认知偏差并非源于技术本身的优劣,而是源于学术出版机制与行业快速迭代之间的结构性矛盾。RSS 2026的截稿日期为1月30日,录用结果4月公布,会议7月举行。从截稿到线下交流,近五个月的时差意味着,会上展示的前沿成果,往往孕育于大半年前。因此,顶会论文更像是对过去技术周期的切片总结,而非对当下最新技术热点的实时回应。

尽管存在时差,VLA依然是当前落地验证最充分的路径。在模仿学习与抓取操作的众多报告中,研究者更倾向于展示模型在真实环境中的动作输出能力,而非单纯的未来状态预测。这也解释了为何即便在资本市场热捧世界模型的背景下,学术界依然在夯实VLA的基础能力。

VLA与世界模型:并非零和博弈

关于VLA与世界模型的争论,在Physical Intelligence(PI)的研究团队中得到了更具辩证性的解答。PI的博士生指出,两者并非互斥,而是针对不同任务形态的最佳适配。

在处理复杂家务或需要逻辑推理的任务时,VLA的语言理解与任务拆解能力不可或缺;而在涉及物理交互、空间移动的任务中,世界模型的视频预测能力则能帮助机器人预判动作后果,规避风险。PI近期的pi0.7架构便是一个典型例证,它在VLA基础上引入了世界模型组件,实现了语义推理与视觉预测的融合。

然而,业界对世界模型的期待往往被高估。PI实习生反问:"你真的见过部署了世界模型的机器人,因为预测到动作有风险而主动停止执行吗?"这一追问直击痛点。目前的世界模型更多是生成逼真的未来画面,缺乏对机器人本体动力学(如手部尺寸、抓取力度)的深刻理解。佐治亚理工学院的Simar Kareer补充道,视频预测若不与动作预测联合学习,生成的未来状态可能视觉合理但物理不可行。因此,世界模型的价值不在于替代VLA,而在于通过"预测-评估"解耦,为高层策略提供低成本的试错空间。

数据工程的范式转移:从Scaling到Curation

数据已成为具身智能的核心瓶颈,但简单的数据堆砌已触及边际效益递减的拐点。Simar Kareer在探讨EgoVerse数据时强调,数据的"清洗、筛选与配比"(Curation)远比单纯增加采集时长重要。

传统的"数据金字塔"假设互联网海量数据可作为基础,但EgoVerse的实验表明,只有将机器人遥操作数据、与任务对齐的人类示范数据以及覆盖长尾行为的自由形态人类数据三者混合,才能产生显著的效果提升。这种"对齐区域"的存在,确保了模型能理解人类行为与机器人动作空间之间的映射关系。

未来数据公司的竞争壁垒,将不在于拥有多少小时的视频素材,而在于能否交付"经过筛选、可直接用于训练"的数据方案。这要求数据供应商具备模型训练与评测能力,从"卖数据"转向"卖数据价值"。

模型丰富的数据贫乏时代

斯坦福大学Karen Liu提出的"Model-rich, Data-poor"框架,为解决数据稀缺提供了新思路。机器人领域虽缺乏大规模真实交互数据,但拥有丰富的仿真、规划与视觉模型。

Karen团队通过VLK框架,利用3D Gaussian Splatting重建环境,结合物理仿真与运动规划模型,自动生成数万条视觉-语言-运动轨迹数据,并成功迁移至真实机器人Unitree G1。这一"Real-to-Sim-to-Real"的闭环证明,已有模型可作为"教师",生成高质量合成数据,从而启动数据飞轮,降低对人工遥操作的依赖。

硬件定义数据,全身智能的系统工程

数据的重要性正在反向重塑硬件设计。Sunday Robotics创始人Tony Zhao提出"数据定义硬件"的理念:先设计用于捕捉技能的Skill Capture Glove,再围绕该手套设计机器人手,最后构建整机。这种"以终为始"的设计逻辑,确保了传感器与执行器能高效服务于数据采集与策略训练。

同时,北京通用人工智能研究院的黄思远与香港大学的李弘扬提出了"全身智能"(Whole-Body Intelligence, WBI)的概念。当前的机器人往往上半身灵巧、下半身稳定,但在复杂动态环境中,移动与操作必须协同。李弘扬指出,全身智能并非依赖单一的端到端大模型,而是需要分层架构:顶层负责语义规划,中层生成全身动作,底层处理平衡与控制。这正如人类小脑负责协调,大脑负责决策,系统化的分层设计才是实现真正具身智能的关键。

中国具身智能:硬件出海与独立叙事

在产业层面,中国具身智能展现出独特的"硬件先行"特征。RSS现场,宇树、智元、诺亦腾等中国企业密集参展,但吸引的受众多为高校研究者与开发者,而非直接采购企业。他们关注的是价格、二次开发接口以及在矿山、巡检等特定场景的ROI(投资回报率)。

相比之下,北美头部公司如PI虽在算法上领先,但距离商业化成熟仍有距离。PI研究员坦言,整个领域尚未出现真正的"奠基性工作"。因此,中国公司不必急于自封为"中国版X"。中国优势在于供应链、硬件交付速度与快速迭代能力,而美国优势在于基础算法与生态创新。

硬件出海只是第一步,真正的挑战在于如何让模型适应本地任务、建立开发者生态并形成数据闭环。中国公司正通过赞助顶会、设立本地团队等方式,逐步嵌入全球技术生态,从"硬件供应商"向"生态参与者"转变。

回归连接:学术会议的真正价值

RSS大会主席Matei Ciocarlie在闭幕演讲中强调,会议的核心价值在于"连接"(Connection)。在焦虑弥漫的技术时代,他建议年轻研究者关注身边的同龄人,因为今天的Conference Buddy就是未来的领域领袖。他提醒观众,视频中的完美演示往往经过修饰,真实进展是集体智慧的缓慢累积。站在RSS这样的顶级舞台,本身就是对研究者能力的最高认可。享受这个时代,与优秀的人同行,比盲目追赶热点更为重要。

具身智能正处于从实验室走向真实世界的关键转折点。无论是VLA与世界模型的融合,还是数据工程的精细化,亦或是全身智能的系统化构建,都在指向一个共识:没有单一的神话,只有复杂的系统工程。中国公司凭借硬件优势已迈出第一步,未来的竞争将更多体现在软件生态、数据闭环与全球本土化能力的深度博弈上。