4K参数撬动VLA泛化:空间表征错位才是具身智能的真正瓶颈
在具身智能快速发展的当下,一个令人困惑的现象普遍存在:那些在实验室环境中表现完美的机器人,一旦进入光线稍变、视角微调或纹理不同的新场景,往往就会瞬间“失智”。传统观点倾向于认为,这是因为模型缺乏足够的物理常识,或者需要更庞大的语言模型来增强推理能力。然而,来自中山大学与X-Era AI Lab团队的最新研究彻底颠覆了这一认知。获得CVPR 2026首届计算透明度冠军奖的论文指出,机器人在新场景下的失效,核心原因并非不懂物理,而是其“看到的空间变形了”。这一发现将改进的焦点从盲目堆砌数据与算力,转向了对模型内部空间表征稳定性的深度审视。
视觉-语言-动作模型(VLA)通常被视为一个端到端的黑盒系统,输入图像与指令,输出动作序列。但这种整体视角掩盖了模型内部不同模块的功能差异。研究表明,VLA实际上由两个功能截然不同但紧密耦合的部分组成:负责空间建模的视觉编码器,以及负责物理建模的语言-动作推理模块。空间建模的任务是从二维图像中恢复物体的三维位置、朝向、遮挡关系及视角结构,形成供下游使用的空间表征;而物理建模则结合任务语义、空间信息及历史动作,进行高层逻辑推理并生成具体操作。当相机视角发生变化时,任务的语义逻辑和所需的物理规律并未改变,真正发生剧烈波动的是空间配置。如果视觉编码器在新视角下产生了偏移的空间表征,即便后端的物理推理模块再强大,也会因为输入信息的失真而导致动作执行失败。这种错位揭示了当前VLA泛化链条中的真正瓶颈:空间表征的不稳定性。
为了验证这一假设,研究团队提出了一套极具创新性的one-shot鲁棒适应框架。该框架的核心思想是,既然问题出在空间表征的错位,那么只需对视觉编码器的输出进行轻量级的校准,而无需对整个庞大的模型进行全量微调。为此,团队设计了两种高效的校准方法:Feature Token Modulation(FTM)和Feature Linear Adaptation(FLA)。FTM方法极为简洁,仅引入两个全局可学习向量,对视觉token进行简单的仿射变换,即重新缩放和居中特征分布。令人惊讶的是,仅学习约4000个参数,FTM就将LIBERO新视角任务的成功率从48.5%大幅提升至87.1%。这一结果有力地证明,极少量的参数调整足以纠正空间表征的偏差,从而释放后端模块潜在的物理推理能力。
在此基础上,FLA方法进一步在ViT编码器的线性层中引入低秩更新,使用约470万个参数完成更深层的特征对齐。在LIBERO新视角测试中,FLA达到了90.8%的成功率,不仅超越了强LoRA基线的90.3%,更关键的是,其参数量从传统的4.67亿大幅降低至470万,减少了近99倍。在扩展的LIBERO-V视觉扰动基准上,面对相机角度、光照变化、纹理差异和传感噪声四类复杂扰动,FLA取得了94.8%的平均成功率,而FTM也以仅0.004M的参数规模达到了90.5%的表现。这些数据清晰地表明,针对空间表征进行有针对性的轻量校准,其效果不输甚至优于全量微调。这不仅降低了计算成本,更提高了模型部署的灵活性,为资源受限的边缘设备应用提供了可能。
这一发现的深层意义在于,它确立了空间智能与物理智能的可分离性。空间智能对应模型对几何结构的建模能力,包括三维位置、视角变化、遮挡关系等;而物理智能则对应模型对动作、接触、约束和因果后果的建模能力。这种分离为构建“原生世界动作模型”(Veridical World Action Model, VWA)提供了理论基础。在VWA的框架下,空间不再是视觉语义的附属品,而是世界动作模型的几何基础;物理也不是动作头后面训练出来的表面能力,而是从预训练阶段就要直接学习的时空演化与因果约束。这意味着,具身智能模型可以被重新设计为一个从几何到物理再到动作的统一系统,而非简单的模块堆叠。
当前许多具身模型仍然沿用“先预训练视觉语言模型或视频模型,再后训练为动作模型”的技术路线。这种路线隐含地假设,语言或视频中的世界知识最终会自然迁移为动作能力。然而,真实机器人需要的不是预测下一个词元,也不只是生成逼真的未来画面,而是在物理世界中准确预测动作及其后果。VWA的核心主张正是对这一错位的修正:如果最终目标是让模型在物理空间中行动,那么预训练阶段就应该直接学习真实世界中的状态、动作和时空变化。模型需要学习密集的4D+x物理预测,包括未来三维位置、运动趋势、接触状态、材质属性、可操作性和环境约束。机器人动作,则可以被看作从这个密集物理预测场中读出的本体轨迹。
真正可缩放的物理智能,可能不来自更大的语言头或更逼真的视频头,而来自一个预训练目标、表征空间和动作输出都与物理世界一致的原生世界动作模型。这种模型不再依赖于从语言或视频中间接推断物理规律,而是直接在物理交互中学习因果关系。例如,模型不仅要识别出“杯子”,还要理解杯子在不同力度抓取下的形变趋势、滑落概率以及与桌面的摩擦系数。这种直接面向物理世界的预训练,能够从根本上解决空间表征与物理推理之间的错位问题,提升机器人在开放动态环境中的适应能力。
此外,这项研究还强调了计算透明度的重要性。获得CVPR Compute Transparency Champion Award,不仅是对研究成果的认可,更是对研究过程透明化的表彰。在具身智能领域,模型的理解能力依赖于对真实世界的准确映射,而研究过程本身也需要真实、透明、可复现。从空间建模与物理建模的分离,到原生世界动作模型的提出,再到计算资源与方法细节的公开报告,这项工作同时推进了两个方向的透明化:让机器人更清楚地理解物理世界,也让研究社区更清楚地理解智能模型是如何被训练、评估与复现的。这种双重透明化对于建立可信的具身智能系统至关重要。
在世界模型、空间智能和物理智能快速汇合的当下,这两篇论文提供了一个简洁但重要的判断:对VLA的有效改进,不应只是把语言、视觉和动作继续堆叠,而应重新理解空间与物理的关系,并在此基础上构建真正原生于物理世界的动作模型。未来的具身智能发展,将不再单纯追求模型参数的规模扩张,而是更加注重表征空间的几何一致性与物理真实性。通过轻量级的空间校准技术,我们可以快速适应新环境;通过原生的物理预训练,我们可以赋予机器人更深层次的因果理解能力。这种从“感知-推理”向“几何-物理-动作”统一范式的转变,将是通往通用具身智能的关键一步。
对于开发者而言,这意味着在设计机器人控制系统时,应更加关注视觉编码器输出的空间表征质量,而非仅仅关注最终的动作准确率。可以通过引入类似FTM或FLA的轻量级适配模块,快速解决特定场景下的空间错位问题。同时,在预训练阶段,应增加对物理交互数据的比重,让模型直接学习动作与状态变化的因果关系,而非仅仅依赖语言描述或视频预测。这种策略不仅有助于提升模型的泛化能力,还能显著降低训练成本和部署难度。
总之,空间表征的错位是当前VLA模型泛化能力不足的主要瓶颈。通过解耦空间建模与物理建模,并采用轻量级的校准方法,我们可以显著提升机器人在新场景下的适应能力。更重要的是,这一发现指引了原生世界动作模型的发展方向,即构建一个预训练目标、表征空间和动作输出都与物理世界一致的统一系统。随着计算透明度的提升和研究方法的规范化,具身智能将迎来更加稳健和高效的发展阶段,真正实现从实验室走向广阔现实世界的跨越。