世界模型驱动的极限具身智能:自动驾驶赛车如何突破认知物理边界

2 阅读

在现代人工智能研究的前沿领域,一个看似简单却又极其复杂的问题正在引发广泛关注:当智能体真正进入物理世界时,它的能力边界究竟在哪里?这个问题的答案,或许可以从一场以近300公里每小时速度进行的自动驾驶赛车比赛中找到线索。

图片

当自动驾驶赛车在F1赛道上以如此惊人的速度与其他车辆进行攻防博弈时,它所面临的挑战已经远远超越了简单的圈速提升。在高频高速的极端条件下,赛车必须在极短的时间窗口内完成复杂的定位与感知任务,准确判断周围对手的位置和意图,预测几秒钟后的交互结果,并做出是超车、防守还是减速的关键决策。更为关键的是,所有这些决策都必须受到轮胎附着特性、车辆动力学约束、执行器能力限制以及稳定性边界的严格制约。

图片

一旦认知判断出现细微偏差,就可能迅速演化为真实的物理失稳现象;而物理能力边界的动态变化,同样会反过来改变智能体可选择的决策空间。这种认知与物理的深度耦合关系,正是新加坡南洋理工大学AutoManLab团队致力于探索的核心问题。他们试图确定具身智能体在真实世界极端工况下进行一体化感知、定位、预测、决策和控制的能力边界,以及认知极限与物理极限之间的相互影响机制。

图片

为了应对这一挑战,研究团队以自动驾驶方程式赛车为实验平台,构建了一套以世界模型为中心的极限具身智能体架构。与传统的将感知、预测、规划和控制视为彼此独立模块的方法不同,该系统利用世界模型同时预测对手交互行为、自车动力学响应以及可行运动范围,并通过真实赛车数据与内部仿真的持续闭环来优化智能体的整体性能。

图片

具身智能的核心理念在于,智能体通过与真实物理世界的持续交互来完成感知、理解、决策和行动的全过程。然而,目前大量的机器人和具身智能研究仍然主要运行在相对保守的安全裕度或中等复杂度环境中。这种方法对于验证算法的基本可行性固然重要,但却难以回答一个更加根本的问题:在真实世界部署时,智能体运行的安全性和可靠性边界究竟在哪里?

图片

研究团队将这一复杂问题分解为两个相互耦合的关键方面。认知极限描述了智能体在高速、动态和不确定环境中构建和更新对世界理解的能力,并基于此进行预测和决策。对于自动驾驶赛车而言,这包括高速定位与感知、对手交互预测,以及在极短时间内选择安全可行且具有竞争力的决策。

图片

物理极限则描述了智能体真正能够执行的运动范围,受到车辆动力学、轮胎与地面作用、执行器能力、空气动力学、路面摩擦、轮胎温度和稳定性等多种因素的共同约束。关键在于,这两类极限并非彼此独立存在,而是形成了复杂的相互影响关系。

图片

在赛车场景中,智能体需要同时面对高强度的对抗性交互以及近极限的动力学控制挑战。车辆需要在极短时间尺度内完成定位、感知和状态估计任务,需要不断判断其他车辆可能采取的行为,同时其控制动作又受到轮胎附着、执行器能力和车辆稳定性的严格约束。当车辆接近物理极限运行时,任何认知误差都可能迅速转化为物理风险;而物理性能边界的变化,又会直接改变智能体可选择的决策空间。

图片

因此,自动驾驶赛车不仅是验证自动驾驶系统性能的重要平台,更为探索具身智能认知与物理的耦合能力边界提供了天然的实验环境。本研究依托全球最大的F1级别自动驾驶方程式赛车联赛A2RL开展,该联赛采用统一的全尺寸SuperFormula赛车平台,将自动驾驶系统直接置于高速、近极限和多车交互环境中,并构建了从高保真仿真到全尺寸实车验证的完整赛事体系。

随着赛事规模的持续扩大,参赛车队已从最初的8支扩展至11支,参与团队来自德国、意大利、美国、日本、法国、中国等多个国家,涵盖了汽车工程与人工智能领域的国际顶尖科技公司、高校和科研机构。Kinetiz车队由南洋理工大学、阿联酋AI科技公司K2以及ALPAutonomy联合组建,在线上仿真赛事中先后在Autonodrome、YasMarinaNorth等分站取得冠军,获得2025年度SIM-Sprint总冠军。在线下阿布扎比全尺寸实车赛事中,赛车实现了接近260km/h的高速自动驾驶,并在阿布扎比亚斯码头F1赛道举行的GrandFinal中获得了2025年度全球第四(亚洲第一)的优异成绩。

持续进行的仿真和实车赛事为团队积累了大量珍贵的数据资源,这些数据在普通实验环境中很难获得,既包括高速稳定运行、超车与防守等成功案例,也包括接近失稳甚至出现失控风险的极限工况。这些数据成为世界模型持续学习的重要基础。

传统自动驾驶系统通常沿着感知—预测—规划—控制的链条逐级工作模式运行。然而,在接近极限的赛车环境中,一个模块的微小误差可能迅速传递到下游模块,造成连锁反应。一个从当前状态看起来合理的超车动作,几秒后可能因为对手封堵路线而变成碰撞风险;一个几何上可行的轨迹,也可能因为轮胎已经接近附着极限而无法真正执行。

因此,团队将世界模型放到了整个智能体的中心位置。这个世界模型同时描述三个关键方面:首先是外部交互将如何演化,例如对手可能加速、防守、让行还是保持当前路线;其次是自车会如何响应,即不同油门、制动和转向输入会导致怎样的速度、横向加速度、横摆和侧偏变化;第三是当前还能做到什么,也就是在当前速度、摩擦、轮胎温度和车辆状态下,哪些运动仍然处在可行范围内。

有了这样的内部预测模型,智能体不再仅仅根据当前看到的信息做决定,而是可以在真正执行之前,先在内部推演多个可能的未来场景。在决策阶段,系统首先生成一条主要决策轨迹,并围绕它形成多个不同策略的候选轨迹。随后,世界模型对这些候选方案分别进行前向推演,评估各种可能的结果。

如果选择左侧超车,对手可能怎样响应?如果继续加速,几秒后的车辆动力学状态是否仍然可控?某条路线虽然更快,但是否会让车辆进入不可行的动力学区域?系统综合交互安全性、物理可行性和速度效率对未来结果进行评分,在真正执行之前过滤掉高风险动作。

在真实轮对轮超车数据中,世界模型预测的对手运动与实际交互过程具有较好的一致性。消融实验显示,在相同场景下,带有世界模型的智能体能够提前识别潜在碰撞风险,而缺少未来预测时,一个当前看来合理的动作可能最终导致碰撞。这体现了世界模型在极限环境中的重要作用:将未来可能发生的情况提前纳入当前决策过程。

预测出合理动作还不够,最终还必须让真实车辆能够执行这些动作。为此,团队进一步利用世界模型描述车辆随速度和运行状态变化的可行加速度包络。随着赛车速度变化,横向加速度、制动能力和驱动能力都在动态变化。与此同时,轮胎温度、路面摩擦以及模型预测误差也会让实际可用的物理极限发生改变。

控制器利用这些动态变化的物理边界约束车辆运动,使规划出来的轨迹最终能够转化为真实可执行的转向、制动和加速指令。真实赛车数据显示,在最高256.3km/h的高速运行中,系统仍能够保持稳定的定位与状态估计;峰值横向加速度达到26.8m/s²,为世界模型学习近极限车辆动力学提供了真实物理数据。

团队还重点研究了一次真实赛车中的失稳案例。在高曲率弯道中,如果车辆在较大的横向载荷下突然加速,同时轮胎温度又不理想,车辆可能迅速失去附着并发生旋转。团队将这一真实失败数据重新引入世界模型,并利用轮胎温度和世界模型预测偏差动态收缩可使用的物理性能边界。在仿真复现中,这种机制能够在失稳真正发生之前主动降低车辆允许使用的极限,从而避免旋转。换句话说,失败不再只是一次事故数据,而成为智能体重新认识自身能力边界的学习信号。

整个系统并不是训练一次后就固定不变的。真实赛车不断产生新的动力学、交互和极限运行数据,这些数据首先用于更新世界模型;更新后的世界模型再生成更多难以在真实赛场反复采集的交互场景和近极限工况,用于进一步优化决策与规划策略。

由此形成一个持续的闭环过程:真实赛车数据→世界模型更新→内部未来推演→策略优化→下一轮运行。随着这一过程持续进行,智能体不仅跑得更快,也逐渐学会更有效地使用自身的认知和物理能力。

在全尺寸自动驾驶赛车仿真中,该方法在复杂对抗场景中取得了88.3%的交互成功率,相比BC和SAC分别提升40.8%和29.3%,平均安全行驶里程超过6.4km。随着世界模型和策略持续迭代,仿真中的平均圈时缩短17.9%,平均速度提高22.0%;平均单圈超车次数由2.78增加至4.80,碰撞率由41.9%降至5.8%。系统还被进一步测试于未参与训练的赛道布局。不同赛道具有不同的曲率分布、连续弯道、高速直道和超车机会,用于检验智能体是否只是记住了某条赛道,还是能够迁移此前学到的世界理解与极限利用能力。结果显示,智能体在多个未见赛道中仍保持接近90%的交互成功率,体现出一定的零样本迁移能力。

这项研究探讨的并不仅仅是如何制造出一辆更快的自动驾驶赛车。对于真正进入物理世界的具身智能体而言,只理解外部世界正在发生什么是不够的。它还需要理解:接下来可能发生什么?自己现在还能做到什么?以及在认知和物理条件共同约束下,下一步应该做什么?

自动驾驶赛车提供了一个极端但清晰的研究场景:在这里,认知误差可以迅速转化为真实的物理风险,而物理极限的变化又会立即改变智能体的决策空间。通过把世界模型放在感知、预测、决策和控制之间,研究团队尝试建立一种新的闭环机制,让智能体能够从成功和失败中持续更新对外部世界和自身能力的理解,并据此不断调整自己的行为。

这种思路并不局限于赛车应用场景。高速移动机器人、无人机、足式机器人、人机协作系统,以及具有复杂接触动力学的机器人操作,都面临类似的问题:智能体不仅需要变得更聪明,也需要知道自己在当前环境下能做到什么、还能做到多少。从这个意义上说,赛车场或许不仅是速度竞争的场地,也正在成为研究极限具身智能的一座实验室。

这项研究为具身智能的发展开辟了新的方向,展示了如何在极端条件下实现认知与物理的深度融合。通过世界模型驱动的方法,智能体能够在复杂动态环境中保持高效、安全的运行,为未来智能系统在真实世界中的广泛应用奠定了坚实基础。研究团队的工作不仅推动了自动驾驶技术的发展,更为整个具身智能领域提供了重要的理论贡献和实践指导。

随着人工智能技术的不断发展,类似的认知物理极限研究将成为智能系统设计的重要考量因素。只有深入理解智能体在真实物理环境中的能力边界,才能确保其在各种复杂场景中的可靠性和安全性。这项研究为这一目标的实现提供了有价值的参考和启示。