具身智能新范式:Harness VLA如何重构模型与系统协同

4 阅读

在具身智能快速发展的当下,行业普遍面临一个看似矛盾的现象:许多视觉语言动作(VLA)模型能够精准完成单次抓取或插入等精细操作,却在执行长程复杂任务时显得力不从心。这种瓶颈并非源于模型算力的不足,而是在于将寻找目标、移动定位、失败重试等长逻辑全部压在同一个端到端模型上,导致系统在动态物理环境中缺乏鲁棒性。针对这一痛点,一种全新的技术范式正在兴起,即从追求单一强大模型转向“模型+系统”的协同进化。

这一转变的核心代表是Harness VLA架构。该架构不再将VLA视为纯粹的端到端执行器,而是在其外围增加了一层Harness Layer,并与代码策略代理(Code Policy Agent)相结合。这种设计使得系统能够自主学会任务分配:VLA专注于处理局部接触丰富、需要高精度控制的精细操作,而长距离移动或逻辑规划则交由解析类动作原语执行。这种分工并非人为硬编码,而是系统在训练过程中自发形成的最优解。在LIBERO-Pro基准测试中,该方案以零样本方式实现了超过80%的成功率,刷新了行业纪录,标志着具身智能在泛化能力上的重要突破。

Harness VLA 智能体化基础设施的技术架构示意图,包

回顾具身智能的技术演进路径,我们可以清晰地看到从感知到决策的跨越。早期的语义SLAM系统如DS-SLAM,主要解决的是机器人在动态环境中的定位与地图构建问题,为机器人赋予了基本的空间感知能力。随后,多智能体强化学习算法MAPPO的出现,开启了on-policy流派的新路线,证明了经过正确实现和充分调参的简单算法在多智能体协作中具有极强的竞争力。这一发现不仅提供了可靠的基线,更揭示了科研中“大道至简”的本质,即算法的复杂度并不天然等同于性能的提升,工程实现的稳定性与评测的公平性往往更为关键。

随着研究深入,基础设施的重要性日益凸显。RLinf框架作为面向具身大模型的强化学习引擎,解决了异构计算、训练调度和系统效率等瓶颈问题。它被英伟达Isaac Lab收录,成为其中唯一由中国团队开发且面向具身大模型的引擎,这表明在具身智能领域,底层基础设施的建设已成为推动上层应用创新的关键力量。RLinf的成功不仅体现在学术引用上,更在于其在工业场景中的实际应用,如与智元机器人的合作,验证了其从实验室走向生产环境的可行性。

清华大学具身决策智能实验室(EDI Lab)的官网首页截图,

然而,从虚拟仿真走向真实物理世界,仍面临着巨大的鸿沟。在仿真环境中,我们假设交互是稳定、同步、低成本且可重复的,但这些基本假设在真实世界中普遍失效。真实环境存在天然的异步性,机器人之间的动作无法精确同步;硬件磨损、碰撞风险以及高昂的维修成本使得试错变得极其昂贵;此外,真实世界的环境变量无法完全重置,摩擦系数、光照条件等细微差异都会影响实验结果的可重复性。因此,单纯依赖仿真训练难以直接迁移到真机,必须引入新的方法来弥合这一差距。

在此背景下,世界模型的角色变得尤为关键。世界模型并非要完美复刻真实世界,而是要根据具体用途满足特定需求。作为模拟器,它需要提供逼真的图像和符合物理规律的反馈;作为评估工具,它需要在可控变量下快速完成测试,避免真机评估中因硬件状态变化导致的偏差;作为预测器,它只需在隐空间中学习状态转换方程,辅助策略做出可靠决策,而无需在视觉细节上做到完美。这种分层理解有助于我们更理性地看待世界模型的局限性与发展方向。

强化学习在具身智能中的核心价值,在于产生交互数据并从中学习物理世界的运行规律。与大语言模型不同,具身智能不能仅靠“纸上谈兵”,必须通过“躬行”来获取重力、摩擦力、质量等物理属性信息。模仿学习虽然能快速提升初始成功率,但难以适应环境动态变化,如杯中水量的改变。只有通过强化学习的在线交互,机器人才能真正理解物理世界的因果关系,从而实现100%可靠的决策。因此,强化学习不是与VLA或世界模型竞争的技术路线,而是完善这些模型不可或缺的后训练阶段。

展望未来,具身智能必然存在其独特的Scaling Law。这不仅涉及模型参数和数据规模的扩大,更关键的是机器人本体数量的规模化。数字空间的Scaling Law仅关注算力与数据,而具身智能引入了物理本体这一新维度。当机器人在真实世界中规模化部署时,多样化的交互数据将带来新的泛化能力增长。这种双重规模化——模型规模化与本体规模化,可能成为通往通用具身智能的有效路径。

目前,行业正处于从实验室研究向产业落地转型的关键期。高校在算力和数据获取上存在天然劣势,而产业界拥有真实场景和数据资源。因此,学术界与产业界的互补合作变得尤为重要。创业公司如正行创新,正致力于依托真实数据构建高质量具身基模,并深耕Agent Infra建设。通过先进入零售和工业级等结构化场景,形成早期数据飞轮,逐步扩大落地范围,最终实现通用能力的突破。

对于从业者而言,未来五年将是具身智能基模真正具备泛化性的关键时期。当前的基模可能存在过拟合现象,但随着更好的数据使用方式和模型架构的出现,这一问题将得到解决。同时,团队构成的多元化也将成为创新的重要驱动力,结合算法、基础设施、机器人本体和应用场景的多学科人才,才能共同推动具身智能向更高水平发展。

在这一进程中,保持对技术的敬畏之心至关重要。创业不仅是技术的比拼,更是团队协作和商业判断的综合较量。成功者寥寥无几,大多数创业者将面临失败的挑战。因此,找到志同道合的伙伴,明确自身优势与短板,构建互补的团队,是在AI时代立足的根本。具身智能的未来,不属于单一的模型或算法,而属于那些能够系统性整合模型、系统与真实世界交互能力的探索者。