VLANeXt解码:12条构建高性能视觉语言动作模型的实用法则
近年来,视觉语言动作(Vision-Language-Action, VLA)模型已成为机器人智能决策领域的核心范式。其基本思想极具吸引力:利用强大的视觉语言模型(VLM)理解环境图像与自然语言指令之间的语义关联,并据此生成精确的机器人控制动作。然而,随着研究热度激增,该领域也面临严重碎片化问题——不同工作采用各异的骨干网络、策略头设计、动作表示方式、训练策略及评估协议,导致难以厘清真正推动性能提升的关键因素。

正是在这一背景下,VLANeXt项目应运而生。它并非又一个追求架构复杂度的新模型,而是一本基于实证研究的“配方手册”和一个高度模块化的开源代码库。其核心目标直指根本性问题:究竟哪些设计选择能实质性地构建出强大的VLA模型?
系统性探索:从简单基线到强大VLA
VLANeXt的研究始于一个极简的RT-2/OpenVLA风格基线。该基线仅接收第三人称视角图像和语言指令,通过复用语言模型中极少使用的文本token来预测离散化的单步动作。尽管概念清晰,但其在LIBERO基准上的表现相当有限。研究团队在此基础上展开了超过500次的消融实验,系统考察了三大维度的设计空间:

- 基础组件:包括骨干网络选择、策略模块结构、VLM与策略的连接方式;
- 感知要素:涉及输入模态(单/多视角、是否包含历史帧)、本体感知信息的注入位置;
- 动作建模范式:涵盖动作表示(离散/连续)、预测粒度(单步/分块)、学习目标(分类/回归/生成式建模)。

这些严谨的实验最终凝练为12条可操作的“配方”,共同构成了VLANeXt的强大基石。
配方1 & 2:专用策略模块的必要性
早期VLA模型常直接复用语言token进行动作预测。然而,动作本质上是连续的物理控制信号,而非离散的语言符号。实验明确显示,分离动作空间与语言token空间至关重要。为此,VLANeXt引入了一个专用的策略头(Policy Head),并配合一个可学习的class token来聚合信息。进一步地,将此策略头扩展为一个包含MetaQuery机制的更强策略模块,能显著提升性能。这表明,为动作预测任务定制一个专属的、具有足够表达能力的子网络,远比强行让通用语言模型“兼职”更有效。

配方3:动作分块预测的优势

机器人执行任务需要规划一段连贯的轨迹,而非孤立的单步动作。VLANeXt采用动作分块(Action Chunking) 策略,一次性预测未来8个时间步的动作序列。这种设计不仅提升了推理效率(减少了决策频率),更重要的是为策略模块提供了对短期未来轨迹的全局视图,有助于生成更平滑、更具前瞻性的动作。

配方4:拥抱连续动作建模

将连续的动作空间离散化为有限的bins是一种简化处理,但会不可避免地损失精度。VLANeXt团队对比了多种动作学习目标,包括bin分类、VQ-VAE码本分类、直接回归、DDIM以及流匹配(Flow Matching)。结果清晰地表明,连续建模方法全面优于离散分类。其中,流匹配因其在生成高质量、高保真连续信号方面的优越性,被VLANeXt采纳为核心动作生成机制。

配方5:更强VLM骨干的正向作用
一个直观的假设是:更强的VLM能带来更强的VLA。实验验证了这一点。通过对比不同规模的VLM骨干,研究发现性能随骨干能力的提升而稳定增长。VLANeXt选择了Qwen3-VL-2B作为其默认骨干,在模型能力与计算效率之间取得了良好平衡。
配方6:VLM与策略间的“软连接”
如何高效地将VLM提取的丰富语义信息传递给策略模块?VLANeXt探索了三种连接策略:松散连接(仅最后一层输出)、紧密连接(逐层连接)和软连接(逐层连接+可学习查询缓冲区)。软连接机制表现最佳。其核心在于那个可学习的查询缓冲区,它像一个信息“翻译器”或“适配器”,能够更灵活、更有针对性地从VLM的深层特征中提取与动作生成最相关的信息,再传递给策略模块,避免了信息过载或错配。
配方7:多视角输入的价值
单一摄像头视角往往不足以支撑复杂的操作任务。VLANeXt同时利用第三人称全局视角和手腕特写视角。前者提供场景布局和物体间关系的宏观信息,后者则聚焦于手-物交互的精细细节。实验证明,这种多视角融合能显著提升模型在复杂任务中的成功率和鲁棒性,因为它为模型构建了更完整的三维空间认知。
配方8 & 9:本体感知信息的最佳注入点
机器人的关节角度、末端执行器位姿等本体感知(Proprioception)信息是决策的关键上下文。VLANeXt的关键发现是,将本体感知信息直接输入到VLM骨干内部,优于将其仅提供给下游策略模块。这样可以让VLM在早期就将机器人的自身状态与视觉、语言信息进行深度融合,形成一个统一的、包含“我在哪、我在看什么、我要做什么”的联合表征,为后续动作生成奠定更坚实的基础。此外,一个简单的线性投影器已足够有效,无需复杂的Transformer式投影器。

配方10:历史视觉帧的取舍

虽然直觉上认为视频历史有助于理解动态,但在VLANeXt的设定下,引入历史视觉帧并未带来增益,有时甚至有害。可能的原因是,冗余的历史信息会分散模型对当前最关键状态的注意力,或引入与当前动作无关的噪声。因此,VLANeXt仅使用当前时刻的双视角图像。值得注意的是,这仅针对视觉输入;历史本体感知信息仍被保留,因为它对理解运动趋势至关重要。

配方11:世界建模的代价与收益
世界建模(World Modeling)通过预测未来观测来学习环境动态,理论上能提升策略的长期规划能力。VLANeXt的实验确认了其有效性,但同时也揭示了其高昂的代价——训练速度降低约三倍。出于对实用性和效率的考量,标准VLANeXt未集成世界建模。不过,项目通过VLANeXt-WAM变体支持了这一方向,为相关研究提供了基线。

配方12:将动作视为时序信号

机器人动作序列本质上是一个结构化的时序信号。受时间序列预测启发,VLANeXt引入了一个轻量级的离散余弦变换(DCT)频域辅助损失。该损失鼓励模型学习平滑、低频主导的动作轨迹,抑制高频噪声和抖动,从而在几乎不增加训练成本的前提下,有效提升了模型的泛化能力。

VLANeXt家族:超越单一基线的研究平台

VLANeXt的贡献远不止于一个强大的2.5B模型。其升级后的代码库已演变为一个支持多方向探索的综合性研究平台,衍生出六大代表性基线:
- VLANeXt-S:采用紧凑的Qwen3.5-0.8B骨干,在LIBERO上达到96.7%的平均成功率,证明了小模型也能有大作为。
- VLANeXt-L/XL:分别基于4B和8B的Qwen3-VL骨干,展示了模型缩放的潜力与局限(4B版达98.4%,8B版反降至97.7%,暗示数据瓶颈)。
- VLANeXt-LAM:引入潜动作学习(Latent Action Learning),先在无动作标签的跨任务视觉轨迹上预训练,再微调。VQ-VAE约束下的潜动作空间被证明最为有效,性能略超标准版。
- VLANeXt-JEPA:在DINO特征空间中进行未来图像预测,将视觉表征学习与动作生成结合,性能得到提升,验证了高级语义特征对动作学习的促进作用。
- VLANeXt-WAM:基于WAN2.2-5B视频生成骨干,实现了世界-动作联合建模,在LIBERO上取得98.2%的成功率,为WAM方向提供了有力证据。

这些变体在统一的训练和评估协议下进行比较,为研究者提供了清晰的锚点,便于探究模型规模、预训练范式、世界模型等不同维度的影响。
实证验证:从仿真到现实
VLANeXt的强大不仅体现在数字上。在更具挑战性的LIBERO-plus基准上,它将平均成功率从69.6%大幅提升至83.9%,展现了卓越的鲁棒性,能够应对相机变化、光照干扰、背景杂乱、语言重述等多种未见扰动。更重要的是,VLANeXt在真实机器人上也成功完成了桌面清理、抽屉开关、篮子搬运等复杂任务,验证了其从仿真到现实的迁移能力。

总而言之,VLANeXt项目通过严谨的实证研究,有力地论证了在机器人基础模型领域,“精巧的设计胜过盲目的规模”。它提供的不仅是一系列SOTA结果,更是一套可复现、可扩展、面向未来的研究基础设施,有望推动整个VLA和机器人基础模型社区走向更系统、更高效的发展路径。