世界模型迈向真实世界:昆仑万维Matrix-Game 3.5的技术跃迁与生态布局
从像素到因果:世界模型的技术突围
世界模型的热度在今年的WAIC上达到了顶点,论坛、展台、发布会,几乎处处可见它的身影。随着具身智能落地元年的到来,AI迈向现实世界的需求变得空前迫切,而世界模型正是连接虚拟与物理的关键桥梁。然而,资本市场的喧嚣背后,技术层面的追问更为朴素:世界模型如何真正理解物理世界?如何从生成连贯画面走向可执行的物理干预?
昆仑万维在7月19日的专场论坛上给出了自己的答案,宣布2026年为世界模型元年,并发布了Matrix-Game 3.5。这款模型被定位为“具备因果推理与行动能力的底层引擎”,其技术突破直指世界模型的核心痛点——物体恒存问题。
物体恒存:世界模型的“阿喀琉斯之踵”
物体恒存,这个三岁孩童都能理解的概念,却让主流世界模型集体翻车。哈佛、MIT、IBM、谷歌联合发布的MemoBench基准测试显示,满分1分的测试中,十个主流模型最高仅得0.58分。问题根源在于,大多数模型只做到了“渲染呈现”这一层,而跳过了“理解当下状态”和“预测下一个状态”这两个关键步骤。
Matrix-Game 3.5将物体恒存问题拆解为三个子问题:记不住、认不出、变不对,并逐一给出了针对性的技术方案。
记不住:从时间索引到空间索引
Transformer架构存在结构性缺陷:注意力窗口越大,早期信息越容易被稀释。谷歌Genie 3也只能保持约一分钟的一致性,之后场景逐渐崩坏。传统模型采用时间索引记忆,如“第5帧左上角有个方块”,这种记忆方式随序列长度线性增长,容易爆炸。而Matrix-Game 3.5实现了业内首个几何对齐的Patch级长期记忆,将记忆从时间索引切换为空间索引,把历史观察提升至三维Patch Memory。每个Patch独立存储、独立检索,通过几何对齐按需调取,模型记住的是“坐标(x,y,z)处有个物体”,而非“第5帧左上角”。这种空间索引方式只随场景复杂度增长,与时长无关,从根本上解决了记忆容量问题。
认不出:从像素匹配到空间对齐
物体重现时识别失败,源于视角变化和背景干扰。传统模型使用3D RoPE位置编码,只编码时间t和二维坐标(x,y),模型知道像素在画面上的位置,却不知道其对应的真实世界坐标。Matrix-Game 3.5引入PRoPE,将相机投影矩阵直接编码进时空位置,让模型学习“这个像素来自哪个视角、对应空间哪个点”。同时,Warped RoPE将记忆Patch的位置从“来自第5帧左上角”升级为“在当前视角下应出现在三维空间的哪个坐标”。
针对背景干扰,Matrix-Game 3.5采用动静解耦记忆:Patch Memory负责静态场景结构,主体参考Token负责动态主体的身份和外观一致性。动态物体在写入记忆前被过滤,避免“一个移动的人”被误认为“多个不同的人”,减少重影与时序混淆。
变不对:从感知状态到因果推理
物体消失期间状态变化,模型既要感知“变了”,还要推演“变成什么样”。传统方法将状态理解和动作生成分开训练,而Matrix-Game 3.5提出状态与动作联合生成范式,将两者放在同一个损失函数下共同优化。模型学的不只是“下一帧长什么样”,而是“如果我做这个动作,世界会怎样改变”。实验证明,联合训练后状态理解和动作预测能力双双显著提升。这种因果推理不是从数据中涌现的,而是被直接写进训练目标,实现了内生的因果推理能力。
迈向真实世界的三大关卡
攻克物体恒存只是起点,昆仑万维的野心是“推动世界模型跨越游戏边界,迈向机器人控制与物理世界交互”。从游戏沙盒到通用物理世界,中间隔着数据、交互、算力三大难关。
数据关:给视频数据装上“物理标尺”
真实世界是失控的,互联网视频缺乏深度标注,无法体现相机视角和运动轨迹。用这些数据训练,模型学到的永远是相对几何关系,不知道动了多少米、朝哪个方向。昆仑万维的解法是给视频数据自动重建物理尺度,搭建了三套自动化管线:多Agent自动调研数千款游戏筛选高价值数据源;自动化离线标注管线估计相机位姿、米制深度、相机内参;Scene-Quality自动评估系统从几何可重建性和生成训练价值两个维度评估数据质量。这些管线产出了500万以上高质量视频切片、1万以上有效训练小时数,覆盖1200多个游戏场景和真实物理场景。
交互关:速度逼平实时,输出直译指令
机器人控制场景中,延迟是安全红线。Matrix-Game 3.5通过三件事将推理推到极限:3步采样蒸馏,将传统扩散模型的几十步去噪压缩到3步;DiT推理优化,采用FFN INT8量化和KV Cache缓存;MG-LightVAE剪枝,对视频编码器做约75%的结构化剪枝。三管齐下,5B参数模型在单张GPU上实现了720P分辨率、约20FPS的实时生成。
算力关:用架构设计替代堆参数
世界模型处理连续视频流,计算量远超语言模型。堆算力不是可持续的路,Matrix-Game 3.5做了一个根本性突破:除角色Reference Adapter外,核心功能几乎不需要新增参数,即可实现交互世界建模,并可快速适配不同视频基础模型。所有交互能力都靠架构设计本身实现,不靠堆参数硬撑。这套交互框架可以快速嫁接到不同的视频基础模型上,不用重写底层,不用为了加交互而牺牲画质。
昆仑万维的引领之道
世界模型的牌桌上,英伟达、谷歌等巨头抢先落座,学术大牛亲自下场,创业公司扎堆涌入。昆仑万维凭什么脱颖而出?
起步最早,技术路线最清晰
从2022年宣布“All in AGI与AIGC”,到2024年Matrix-Zero开启空间智能探索,再到2025年Matrix-Game 1.0、2.0接连发布,2026年3.0、3.5相继炸场,昆仑万维用一次次技术迭代验证了一条清晰完整的开发路线:双向DiT预训练→Self-Forcing/Causal Forcing蒸馏为因果模型→KVCache流式推理+记忆注入→25FPS的实时交互水平。当行业还在争论“世界模型到底是什么”,Matrix-Game团队已经给出了清晰的定义框架。
开源最坚决,拿下标准定义权
昆仑万维Matrix-Game系列模型“一次发布一次开源”的节奏,展示了其对开源的态度。2025年5月,Matrix-Game作为工业界首个10B+空间智能大模型正式开源;三个月后,Matrix-Game 2.0成为业内首个在通用场景上实现实时长序列交互式生成的开源方案。更重要的是,它是国内唯一能够对标谷歌Genie的开源方案。开源的价值很快得到验证:DiT作者谢赛宁基于Matrix-Game 2.0开源底座发布了全球首个多人视频世界模型Solaris;NVIDIA和浙大基于Matrix-Game 3.0模型联合发布了Light Interaction。NVIDIA的SANA-WM、Adobe的RELIC等国际头部大厂的世界模型工作,均将Matrix-Game相关模型作为对比基准。先开源者拿定义权,后来者只能兼容。
生态最系统,壁垒越跑越厚
2026年3月,昆仑万维发布“4+3”AGI战略:四大模型底座(视频模型、音乐音频模型、世界模型、基座文本与多模态模型)和三大平台经济体(AI短剧、AI音乐、AI游戏)。世界模型在这里不是孤立的技术模块,而是整个生态的底层引擎。游戏平台跑出交互数据,视频平台产出训练素材,音乐平台丰富感知维度。数据从平台流向模型,模型能力反哺平台体验,体验吸引更多用户,产生更多数据,形成“模型-平台-数据”三端闭环。后来者追的不仅仅是一个单一世界模型,而是一整个生态。
技术范式上限最高,因果推理能力“内生”
谷歌Genie 3的因果理解是在海量视频中隐式学习的统计关联,目标是生成物理合理的视频内容,回答“给定当前画面和用户操作,下一帧该长什么样”。而Matrix-Game 3.5的目标是输出可执行的物理控制指令,回答“给定当前状态和预期结果,我该做什么动作”,成功标准是“指令执行后物理结果正确”。因此,它将因果推理作为架构的第一性,采用状态与动作联合生成范式,这种因果是“长”出来的,不是从数据里“看”出来的。一个服务于“视觉模拟”,一个服务于“物理干预”,目标决定了技术范式,技术范式决定了模型的能力上限。
世界模型的新起点
Matrix-Game 3.5不是终点,而是一个支点。机器人训练不再需要真实世界的百万次试错,在世界引擎里,机器人摔一万个碗,成本只是Token“电费”。自动驾驶仿真不再需要封闭测试场的昂贵场景,暴雨、黑夜、突发横穿,一键生成。这些场景需要的不仅仅是“看起来像真的”,更要求“行为上真的”——杯子会碎、墙不能穿、左转后视角真的变了、十分钟后回来杯子还在。
传统游戏引擎的代码逻辑已经过时,Matrix-Game 3.5用几何理解、空间记忆和因果推理,让世界第一次在模型里“活”了过来。2026年7月19日,世界模型走向真实物理世界,由Matrix-Game 3.5开始。率先出牌的昆仑万维,正在定义世界模型整张牌桌的规则——国产世界模型,第一次跑出了“全球技术引领者”的姿态。