昆仑万维Matrix-Game 3.5:破解物体恒存难题,重塑世界模型因果推理

0 阅读

在人工智能迈向物理世界的征途中,世界模型正从概念验证走向核心基础设施的建设阶段。2026年,随着具身智能落地需求的爆发,行业焦点已从单纯的视觉生成质量,转移至模型对物理规律的理解深度与交互能力的可靠性上。昆仑万维推出的Matrix-Game 3.5,正是在这一背景下诞生的关键技术突破,它不仅解决了长期困扰行业的“物体恒存”难题,更通过架构创新实现了因果推理的内生化,为AI进入真实世界提供了可信的逻辑底座。

长期以来,主流世界模型在应对“物体恒存”测试时表现不佳。哈佛、MIT等机构联合发布的MemoBench基准显示,现有模型在物体离开视野后重新出现时,往往无法正确恢复其身份、位置及状态变化。这一缺陷的根源在于,大多数模型仅停留在像素层面的渲染预测,缺乏对三维空间结构的深层理解。它们依赖时间索引记忆历史帧,导致随着序列延长,早期信息被稀释,场景一致性迅速崩坏。Matrix-Game 3.5通过引入几何对齐的Patch级长期记忆机制,从根本上重构了模型的记忆方式。它将记忆单元从整帧图像细化为局部图像Patch,并建立基于三维坐标的空间索引。这意味着模型不再记忆“第几帧的某个像素”,而是记忆“空间中某坐标处的物体属性”。这种从时间索引向空间索引的切换,使得模型能够像人类一样,无论视角如何变化或时间间隔多久,都能准确检索并还原物体的真实状态,从而在MemoBench评测中取得了显著突破。

除了记忆机制的重构,视角不变性与动静解耦也是实现物体恒存的关键环节。传统模型使用3D RoPE位置编码,仅能处理二维画面坐标,难以应对相机运动带来的像素位移。Matrix-Game 3.5引入PRoPE技术,将相机投影矩阵直接编码进时空位置,使模型能够理解像素背后的三维空间对应关系。同时,针对动态场景中背景与前景混淆的问题,该模型采用了动静解耦记忆策略。静态背景通过Patch Memory存储,作为空间定位的锚点;动态主体则通过参考Token维持身份一致性。这种分离处理有效避免了移动物体被误识别为多个不同实体,减少了重影与时序混淆,确保了模型在复杂动态环境下的感知稳定性。

在解决感知问题的基础上,Matrix-Game 3.5进一步将因果推理能力植入模型的核心训练目标。传统世界模型通常采用分步训练策略,先理解状态再生成动作,导致因果链条断裂。而Matrix-Game 3.5提出了状态与动作联合生成的新范式,将两者置于同一损失函数下进行共同优化。模型不仅学习预测下一帧的视觉内容,更学习预测“执行特定动作后世界状态的改变”。这种内生式的因果推理能力,使得模型能够从统计关联中解脱出来,真正理解物理世界的因果逻辑。实验证明,联合训练显著提升了模型的状态理解与动作预测精度,为其在机器人控制等需要精准干预的场景中应用奠定了理论基础。

从虚拟游戏环境迈向真实物理世界,数据、交互与算力是必须跨越的三道关卡。在数据层面,互联网视频缺乏深度与相机参数标注,限制了模型对物理尺度的理解。昆仑万维构建了三套自动化数据管线,通过多Agent筛选高价值数据源,自动估计视频的相机位姿、米制深度及内参,并利用Scene-Quality系统评估数据质量。这一过程产出了数百万高质量视频切片,为模型装上了“物理标尺”,使其能够理解真实的距离与速度概念,而非仅仅识别像素排列。在交互层面,为了满足机器人控制对低延迟的严苛要求,Matrix-Game 3.5通过3步采样蒸馏、DiT推理优化及MG-LightVAE剪枝等技术,将5B参数模型的生成速度提升至720P分辨率下约20FPS的实时水平,确保了交互的即时性与安全性。

算力可持续性是世界模型大规模落地的另一大挑战。面对连续视频流巨大的计算开销,单纯堆叠算力并非长久之计。Matrix-Game 3.5通过架构设计实现了轻量化交互框架,除角色参考适配器外,核心功能无需新增大量参数即可实现交互建模。这种设计不仅保留了基础视频模型的生成质量,还使得交互能力能够快速适配不同的视频基础模型,降低了部署成本与技术门槛。这种以架构创新替代参数堆叠的思路,为世界模型的可迁移性与广泛落地提供了可行路径。

昆仑万维在世界模型领域的领先地位,得益于其清晰的技术路线、坚决的开源策略以及系统的生态布局。从Matrix-Zero到3.5版本的持续迭代,验证了其从双向DiT预训练到因果模型蒸馏,再到实时交互推理的完整技术路径。更重要的是,通过坚持开源,Matrix-Game系列已成为全球学术界与产业界的重要参照系。纽约大学谢赛宁教授基于其底座开发多人视频世界模型Solaris,NVIDIA与浙江大学也与其合作发布相关研究成果,这充分证明了其技术底座的国际竞争力。开源不仅带来了社区反馈与快速迭代,更帮助昆仑万维掌握了事实标准的定义权。

在生态层面,昆仑万维构建了“4+3”AGI战略,将世界模型作为底层引擎,与视频、音乐、文本模型及AI短剧、音乐、游戏平台形成闭环。游戏平台提供交互数据,视频平台产出训练素材,模型能力提升反哺平台体验,形成了数据与算力的良性循环。这种系统性的生态壁垒,使得竞争对手难以通过单一模型进行追赶。相较于谷歌Genie 3等侧重于视觉模拟的模型,Matrix-Game 3.5更注重输出可执行的物理控制指令,其技术范式上限更高,更契合具身智能与自动驾驶等真实应用场景的需求。

综上所述,Matrix-Game 3.5的发布不仅是技术参数的提升,更是世界模型发展范式的转变。它标志着AI从被动观察世界转向主动理解并干预物理世界,从像素复现转向因果推理。通过解决物体恒存、实现实时交互及优化算力结构,昆仑万维为国产世界模型在全球竞争中赢得了引领地位。未来,随着该技术在机器人训练、自动驾驶仿真等领域的深入应用,世界模型将成为连接数字智能与物理现实的关键桥梁,推动人工智能真正融入并服务于真实世界。