4K参数撬动VLA泛化瓶颈:为何空间表征才是具身智能的核心钥匙?
突破“黑盒”迷思:重新审视VLA的泛化边界
在具身智能(Embodied AI)领域,一个长期的共识是:赋予机器人更强大的感知与推理能力,必须依赖更大规模的视觉-语言-动作模型(Visual-Language-Action, VLA)。然而,随着模型参数量呈指数级增长,学术界开始反思这种“堆砌”策略的有效性。最新发表于CVPR 2026并荣获计算透明性冠军奖的研究指出,当前VLA在应对新视角、光照变化及纹理干扰时表现出的脆弱性,其根源往往不在于物理推理能力的缺失,而在于空间表征的严重错位。
这一发现颠覆了传统的端到端优化思路。当相机视角发生微小偏移,或者环境纹理发生变化时,VLA中的视觉编码器往往会产生扭曲的空间特征。这种扭曲并非语义层面的误解,而是几何结构层面的失真。后端强大的语言与动作推理模块,虽然保留了对物理规律的理解,却因接收到错误的空间输入而无法执行正确动作。因此,解决泛化瓶颈的关键,并非继续扩大模型体量,而是重新校准模型对真实三维空间的感知能力。
解构VLA:空间建模与物理建模的分离实验
传统观点常将VLA视为一个不可分割的整体模块,输入图像与指令,直接输出关节力矩或动作序列。但中山大与X-Era AI Lab团队的研究通过精细的模块化拆解,揭示了模型内部的两个独立功能层:空间建模与物理建模。
空间建模层主要由视觉编码器承担,其核心任务是从二维图像中恢复物体的三维位置、朝向、遮挡关系以及视角结构。这一过程旨在构建一个稳定、一致的世界地图,供下游策略使用。相比之下,物理建模层由视觉语言模型(VLM)与动作专家组成,负责结合任务指令、空间表征及历史动作,进行高层逻辑推理并生成可执行的动作序列。
研究表明,当环境发生扰动时,真正发生变化的是空间配置,而非任务语义或底层物理规律。这意味着,后端策略模块本身并未失效,失效的是它与后端策略之间的“通信接口”——即被扭曲的空间表征。这一洞察将优化焦点从宏大的模型架构设计,精准定位到了具体的特征对齐问题上:如何让模型“看到”的空间,与物理世界真实存在几何关系保持一致?
极致轻量化:4K参数实现的鲁棒性跃迁
验证上述假设的最有力证据,来自于一组极具颠覆性的轻量级校准实验。研究团队提出了一套One-Shot鲁棒适应框架,试图用极少的可学习参数来修复VLA的空间感知缺陷。
其中,特征令牌调制(Feature Token Modulation, FTM)方案仅引入了两个全局可学习向量,对视觉Token进行简单的仿射变换(重新缩放和重新居中特征分布)。令人震惊的是,仅通过调整这约4K个参数,LIBERO基准测试中新视角任务的成功率便从48.5%飙升至87.1%。这一提升幅度几乎等同于全量微调的效果,但计算成本降低了数个数量级。
为了进一步验证空间校准的深度价值,团队还设计了特征线性适配(Feature Linear Adaptation, FLA)。该方案在ViT编码器的线性层中加入低秩更新,仅需约4.7M参数,便在LIBERO新视角测试中达到了90.8%的成功率,超越了强LoRA基线(90.3%)。值得注意的是,FLA的参数量仅为467M的1%,实现了约99倍的参数压缩。
在更复杂的LIBERO-V视觉扰动基准(涵盖相机、光照、纹理和噪声四类扰动)上,FLA取得了94.8%的平均成功率,而FTM以仅0.004M的参数也达到了90.5%。这些数据无可辩驳地证明:空间表征是VLA泛化链条中真正的瓶颈,且对空间特征的针对性轻量校准,足以解决绝大多数泛化难题。
迈向原生世界动作模型(VWA)
这项研究更深层的理论贡献在于,它提出了**原生世界动作模型(Veridical World Action Model, VWA)**的构想。在VLA架构中,空间智能与物理智能往往是混合训练的,导致模型难以区分几何约束与物理因果。VWA主张将二者解耦,并重新构建从几何到物理再到动作的统一系统。
在VWA框架下,空间不再是视觉语义的附属品,而是动作模型的几何基础;物理也不再是动作头后训练出来的表面统计规律,而是从预训练阶段直接学习的时空演化与因果约束。当前许多具身模型沿用“预训练视觉语言模型/视频模型,再后接动作头”的路径,隐含假设语言或视频中的世界知识能自然迁移为动作能力。然而,真实机器人需要的不是预测下一个词元或生成未来画面,而是在物理空间中预测动作及其后果。
VWA的核心主张是对这一错位的修正:如果最终目标是让模型在物理世界中行动,那么预训练阶段就应该直接学习真实世界中的状态、动作和时空变化。模型需学习密集的4D+x物理预测,包括未来三维位置、运动趋势、接触状态、材质属性及环境约束。机器人动作,本质上是从这个密集的物理预测场中读出的本体轨迹。这种架构不再依赖大语言模型的间接推理,而是建立在直接感知物理世界演化的原生基础之上。
透明计算:具身智能的可复现性范式
值得一提的是,该研究获得CVPR 2026计算透明性冠军奖,表彰其在计算资源、实验方法及可复现细节上的示范性报告。这一荣誉与研究主题形成了深刻的呼应:具身智能需要模型理解真实世界,而研究过程本身也需要真实、透明、可复现。
从空间与物理建模的分离,到原生世界动作模型的提出,再到计算细节的公开,这项工作同时推进了两个维度的透明化:让机器人更清晰地理解物理世界,让社区更清晰地理解智能模型的训练与评估过程。在世界模型、空间智能和物理智能快速汇合的当下,这一简洁而有力的判断正在重塑行业方向:对VLA的有效改进,不应是无尽的参数堆叠,而是回归空间与物理的本质关系,构建真正原生于物理世界的动作模型。