全球首个具身视频基模LingBot-Video:MoE架构如何重塑机器人视觉?

0 阅读

从“好看”到“好用”:视频生成模型的具身化转折

长期以来,视频生成大模型的发展轨迹呈现出一种有趣的割裂感。一方面,以Sora、Wan2.6为代表的通用视频生成模型在画质细腻度、光影渲染和创意叙事上达到了令人惊叹的水平,它们更像是数字世界中的“导演”,服务于影视创作和广告营销。然而,对于具身智能(Embodied AI)而言,仅仅“好看”是远远不够的。机器人需要的是能够反映真实物理规律、具备逻辑连贯性且符合动力学约束的视频数据。如果生成的视频中机器人违反了重力法则或穿透了桌腿,那么这些数据对于训练机器人感知和行动系统不仅毫无价值,甚至会产生负面的误导。

这种供需错配催生了视频生成技术的第二条演进路径:服务于物理世界的理解、预测与交互。2026年7月9日,蚂蚁灵波正式开源LingBot-Video,标志着这一领域的一个里程碑时刻。作为全球首个基于Mixture-of-Experts(MoE)架构、专门面向具身智能优化的开源视频生成基础模型,LingBot-Video并非单纯追求视觉特效的堆砌,而是试图解决一个核心痛点:如何让视频模型像机器人一样“思考”物理世界。它不再仅仅是生成像素的算法,而是成为连接数字感知与物理行动的桥梁,为机器人连续预测、规划和执行任务提供了全新的开源底座。

RBench基准上的硬核验证:物理合理性优于美学表现

判断一个具身视频模型是否真正具备“具身能力”,不能仅凭肉眼观察其流畅度,必须依赖科学的量化评估。为此,蚂蚁灵波联合业界构建了面向机器人操作视频的综合评测基准——RBench。该基准的核心设计逻辑非常明确:重点考察模型能否生成符合真实物理规律的机器人行为,包括物体交互的接触点、运动轨迹的惯性以及多物体碰撞后的状态变化等。

在RBench的严格测试下,LingBot-Video交出了一份极具说服力的答卷。其总分达到0.620,这一成绩显著超越了当前市场上主流的通用视频生成模型。具体对比来看,Wan2.6得分为0.607,Seedance1.5 Pro为0.584,而NVIDIA Cosmos3 Super则为0.581。这种分数的差异并非细微的统计波动,而是反映了底层逻辑的本质不同。Wan2.6等模型虽然在生成人类舞蹈或自然风景时表现优异,但在处理复杂的机器人操控场景时,往往会出现动作断裂或物理幻觉。相比之下,LingBot-Video在生成机器人相关视频时,能够保持动作过程的合理性及任务执行的完整性。

为了进一步验证其对物理世界变化的建模能力,蚂蚁灵波还进行了一组内部多维度的横向对比。在通用质量与具身领域两个维度上,LingBot-Video均展现出相对于NVIDIA Cosmos3、Wan2.2 A14B、LongCat-Video、Hunyuan Video1.5以及LTX-2.3等五个主要开源基线的优势。特别是在具身场景评估中,其物理理解能力和动作一致性显著领先,证明了其并非通过简单的数据过拟合来骗取高分,而是真正学到了动作与环境之间的因果联系。

架构重塑:DiT+MoE带来的效率与容量平衡术

LingBot-Video之所以能在性能与效率之间取得平衡,首要原因在于其底层的架构创新。传统的大规模视频生成模型多采用Dense(密集)架构,即每次推理都需要激活所有参数。这种设计在拥有巨大参数规模时,虽然能带来丰富的细节表现力,但计算成本极高,难以满足具身智能对实时交互和低延迟控制闭环的需求。具身机器人往往需要在毫秒级时间内根据视觉反馈调整动作,庞大的计算开销无疑是巨大的瓶颈。

对此,LingBot-Video采用了DiT(Diffusion Transformer)结合MoE(Mixture-of-Experts,混合专家)的设计方案。MoE架构的核心思想是将庞大的模型参数分割成多个小型的“专家”模块,在每次推理时,根据输入内容的特征,动态地激活其中一小部分专家进行计算。具体到LingBot-Video,其总参数量达到了惊人的30B,但在实际生成过程中,仅激活约3B的参数。

这一设计带来了约3倍的推理效率提升。这意味着,在同等硬件资源下,LingBot-Video的处理速度远快于同等规模的传统Dense模型。更重要的是,这种效率提升并未牺牲模型的视觉表达能力。通过MoE机制,模型依然能够利用30B参数的庞大知识库来理解复杂的场景语义和物理细节,而3B的激活参数则确保了足够的推理带宽。对于需要在边缘设备或算力受限的机器人本体上部署的应用场景而言,这种“大模型小推理”的特性具有极高的实用价值。

数据基石:从海量互联网视频到7万小时具身数据

模型的性能上限很大程度上取决于训练数据的质量与多样性。早期的视频生成模型主要依赖互联网上爬取的通用视频数据,这些数据虽然丰富,但大多侧重于人类的表演、自然景观或电影片段,缺乏对物体物理属性、力学交互以及机器人操控细节的深度标注。

LingBot-Video在数据构建上进行了系统性的革新。蚂蚁灵波开发了一套独特的“数据画像引擎”,在清洗和处理海量互联网视频的基础上,重点引入了来自VLA(Vision-Language-Action)、VLN(Vision-and-Language Navigation)以及Ego(第一视角)等机器人相关领域的高质量数据。这些数据涵盖了灵巧操作、机器人移动、第一视角交互等多种高难度场景。

经过精心筛选与标注,LingBot-Video的具身专用训练数据总规模达到了7万小时。这是一个极具分量的数据资产。通过这些数据,模型不再只是学习视频表面的纹理、色彩和光影风格,而是深入学习了动作与环境变化之间的深层关系。例如,当机械手抓取一个易碎物品时,模型能学习到手指闭合力度与物品形变之间的微小关联;当轮式机器人在不同材质表面移动时,模型能理解摩擦力对运动轨迹的影响。这种基于物理因果的数据注入,使得LingBot-Video生成的视频具有了真实的“物理质感”,而不仅仅是视觉上的逼真。

训练范式:多维强化学习与物理规律对齐

有了先进的架构和丰富的数据,如何让模型真正“学会”物理世界,还需要训练范式的创新。LingBot-Video引入了多维强化学习奖励系统,这是其区别于传统视频生成模型的关键一环。

在传统的视频生成训练中,优化目标通常集中在美学评分、Prompt跟随能力(即生成的视频是否符合文字描述)以及运动一致性(帧与帧之间的平滑度)上。这些指标固然重要,但对于具身智能来说,它们并不足以保证生成内容的可用性。如果一段视频在美学上无懈可击,但违反了能量守恒定律,那么它对机器人来说就是无效的噪声。

因此,LingBot-Video在奖励函数中加入了物理合理性和任务完成度两个关键维度。通过强化学习,模型被引导去生成那些符合真实世界物理规律的结果。例如,如果生成的视频中物体在没有外力的情况下发生悬浮运动,或者机械臂的关节运动出现了非人类或机器人难以复现的奇异轨迹,模型将受到惩罚。反之,如果生成的视频展示了稳定的抓取动作或符合动力学特征的倾倒过程,模型将得到奖励。

这种对齐机制使得LingBot-Video生成的视频不仅“看起来”像机器人做的动作,更“算起来”是机器人能做的动作。这种物理层面的对齐,为后续的动作预测、仿真数据生成等应用奠定了坚实的基础。它让视频生成从一种纯粹的“创造力”任务,转变为一种兼具“逻辑性”和“可执行性”的工程任务。

应用场景拓展:从动作预测到世界模型研究

LingBot-Video的开源,其意义不仅仅在于提供一个新的生成模型,更在于为具身智能的多个关键环节提供了新的解决方案。

首先是机器人动作预测。传统的方法往往依赖物理引擎进行模拟,计算量大且难以处理复杂的人机交互场景。LingBot-Video可以利用其强大的视觉理解能力,根据当前的环境状态和指令,预测未来几秒内机器人和物体的状态变化,从而辅助规划模块生成更安全的动作路径。

其次是仿真数据生成。具身智能的发展严重依赖于高质量的仿真数据,但现有的仿真引擎在模拟复杂物理交互和非刚性物体变形时仍存在局限。LingBot-Video可以生成高保真的视频数据,用于增强仿真训练的真实性,填补仿真与真实世界之间的“现实鸿沟”。

此外,在动作条件建模和世界模型研究领域,LingBot-Video也展现出巨大潜力。作为世界模型的一部分,它可以学习环境的动态变化规律,帮助机器人在未知环境中进行推理和决策。由于其基于MoE的高效推理特性,这使得将其嵌入到实时控制闭环中成为可能。

LingBot-Video的开源,标志着视频生成技术从“数字娱乐”向“物理智能”迈出了关键一步。它证明了AI不仅仅是创造虚幻影像的工具,更是理解并模拟现实世界物理规律的重要伙伴。随着更多开发者基于这一开源底座进行创新,我们有望看到具备更强环境适应能力和任务执行能力的具身智能体在未来几年内迅速涌现。这不仅是算法的胜利,更是计算范式向更贴近物理世界本质演进的结果。