中国开源世界模型InSpatio-World vs 李飞飞Atlas:谁在空间智能赛道真正领先?
当李飞飞于2026年9月初高调推出其创业公司World Labs的首款产品——多模态世界模型Atlas时,科技界一片沸腾。媒体称其为“空间智能的里程碑”,网友惊叹于仅凭几张图片就能生成连贯、结构一致的3D场景并自由切换视角的能力。然而,在这场看似由硅谷引领的技术叙事背后,一个被忽视的事实是:中国团队影溯(Yingsuo)早在2026年3月就已开源了功能相近甚至在某些维度更具前瞻性的世界模型InSpatio-World,并已在国际权威评测中证明其实力。

这种“中国先行、海外跟进”的现象,不仅挑战了我们对AI创新节奏的惯常认知,更揭示了一个关键趋势:世界模型的竞争正从单纯的生成质量,转向对物理世界结构、动态规律和时空一致性的深层建模能力。

技术路径分野:静态3D vs 动态4D

Atlas的核心突破在于构建了一个统一的空间上下文框架,将文本、图像、视频乃至3D信息融合其中。用户输入少量图像后,模型能重建出具有几何一致性的三维场景,并允许虚拟相机沿任意轨迹移动,生成新视角下的图像,且保持物体位置、遮挡关系和光照逻辑的连贯性。这本质上是一种静态3D世界建模——它假设场景在观测期间是静止的,重点在于空间结构的完整性与视角变换的合理性。

相比之下,影溯的InSpatio-World从设计之初就锚定动态现实世界。其输入不是静态图像,而是一段普通视频。模型的任务是从这段有限的时空观测中,推断出一个可探索的4D时空场(3D空间+时间)。这意味着用户不仅可以改变观察位置,还能改变观察时刻。例如,一段行人过马路的视频,经InSpatio-World处理后,用户可以从侧面、上方甚至行进方向的前方视角,回看同一事件在不同时间点的状态。

这一差异看似细微,实则代表了两种不同的世界建模范式。Atlas更像一个高保真的虚拟摄影棚,目标是构建一个可供任意机位拍摄的静态舞台;而InSpatio-World则试图将一段现实录像“升维”为一个可驱动的动态世界副本,使其成为物理AI(如自动驾驶、服务机器人)进行策略预演和行为预测的理想沙盒。

WorldArena登顶:靠的不是画面,而是物理逻辑

影溯的技术实力并非空谈。在2026年8月发布的WorldArena 2.0权威榜单中,其模型InSpatio-Curious以66.11分高居榜首,超越全球77个参评模型。尤为值得注意的是,它的Image Quality(图像质量)得分仅为60.64,远低于第二名,却依然夺冠。这恰恰说明,该评测体系的价值取向已发生根本转变。

WorldArena由清华大学、上海交通大学、香港大学等顶尖学府联合发起,专为具身世界模型(embodied world models)设计。与传统视频生成评测不同,它模拟的是机器人在真实环境中执行任务的场景。评测不仅看画面是否清晰美观,更关注以下核心能力:

- Trajectory Accuracy(轨迹准确性):模型生成的物体或相机运动路径是否符合真实物理规律。InSpatio-Curious在此项得分为64.89,领先第二名超3分。
- Depth Accuracy(深度准确性):场景中各点的深度估计是否精确。其得分高达99.29,几乎接近完美。
- Physics Adherence(物理一致性):当物体受外力作用时,其后续运动是否遵循牛顿力学等基本物理法则。73.24的得分位列第一。
- JEPA Similarity(时空表征相似性):基于联合嵌入预测架构(JEPA)的理念,衡量模型内部时空表征与真实世界观测的一致性。98.36的高分表明其对世界状态的编码极为忠实。

这些指标共同指向一个结论:InSpatio-Curious的优势不在于“看起来像”,而在于“行为上真”。对于需要与物理世界交互的智能体而言,后者才是决定成败的关键。
数据瓶颈与SIDO计划:打造空间智能的“ImageNet”
尽管模型能力突飞猛进,但整个空间智能领域仍面临一个根本性制约:缺乏大规模、高质量、多样化的3D/4D真实世界数据。当前多数研究依赖合成数据或小规模采集,难以覆盖真实环境中复杂的光照、材质、动态交互和长尾场景。
正是意识到这一点,影溯在2026年8月底的第二届中国空间智能大会上,联合20余家高校、激光雷达厂商、机器人公司及3D内容平台,共同发起SIDO(Spatial Intelligence Data Open)。该计划旨在构建一个覆盖百万级场景的3D/4D开放数据底座,并同步建立统一的评测基准。
SIDO的运作逻辑是打通“数据-模型-应用”闭环:
- 数据生产方(如测绘机构、自动驾驶车队、AR/VR内容创作者)贡献原始空间数据;
- 模型研发方利用这些数据训练更鲁棒的世界模型;
- 应用方(如工业机器人、家庭服务AI)在真实任务中验证模型效果,并反馈新的数据需求。
这种协同机制有望加速空间智能从实验室走向产业落地。正如ImageNet之于计算机视觉,一个高质量、标准化的空间数据集将成为推动整个领域进步的基础设施。
超越生成:世界模型的终极使命是赋能智能体
无论是Atlas还是InSpatio-World,其意义远不止于生成酷炫的视觉内容。它们的真正价值在于为具身智能体(embodied agents)提供一个可交互、可预测、可规划的内部世界模型。在这个模型中,智能体可以安全地试错、预演行动后果、理解因果关系,从而在真实世界中做出更优决策。
例如,一个家庭服务机器人若搭载InSpatio-World,便能在看到主人拿起水杯的瞬间,预测其可能走向厨房接水,并提前清理路径上的障碍物;一辆自动驾驶汽车若集成此类模型,则可在复杂路口提前模拟其他车辆的多种可能轨迹,选择最安全的通行策略。
从这个角度看,世界模型的竞争已不仅是算法之争,更是对物理世界理解深度的竞争。谁能更准确地捕捉空间结构、时间演化和物理规律,谁就能为下一代AI智能体提供更可靠的“心智地图”。
结语:一场静默的领跑
李飞飞的Atlas无疑是一次重要的技术展示,但影溯的InSpatio-World及其在WorldArena上的表现,揭示了一个更值得深思的现实:在全球AI竞赛中,中国团队不仅没有掉队,反而在某些前沿方向实现了静默的领跑。这种领先并非依靠营销声量,而是扎根于对技术本质的深刻洞察——智能的本质不是生成逼真的幻象,而是构建一个与真实世界同构、可交互、可推理的内部模型。
随着SIDO等基础设施的推进,中国在空间智能领域的系统性布局或将释放更大潜力。未来的胜负手,或许不再是谁先发布一个惊艳demo,而是谁能率先构建起从数据、模型到应用的完整生态,并真正让AI学会“理解”这个世界,而不仅仅是“模仿”它。