三部手机拍出“子弹时间”:李飞飞团队新模型 Atlas 如何用几张照片重建三维世界

0 阅读

从三张照片到三维世界

你有没有想过,只用三部手机架在三脚架上,拍一段有人投篮或草莓掉进牛奶的画面,就能生成《黑客帝国》里那种时间凝固、镜头环绕的“子弹时间”效果?这听起来像电影特效团队的专属能力,但现在,李飞飞(Fei-Fei Li)联合创立的公司 World Labs 推出的新模型 Atlas,让这件事变得触手可及。

文章配图

Atlas 的核心能力叫“新视角预测”——给它一个场景的若干视角(哪怕只有两三张),它就能推断出从任意新位置、新角度看到的画面应该长什么样。这不是简单的图像插值,而是基于对空间几何的理解,生成在三维结构上自洽的内容。换句话说,它既在“生成”,也在“重建”,而且把这两件事放在同一个模型里完成。

文章配图

过去,生成逼真画面是文生视频模型的强项,而精确重建三维结构则是计算机视觉的传统领域,两者泾渭分明。Atlas 打破了这道墙。它接收的每一张输入图像都带有明确的相机位姿(即拍摄时的位置和朝向),这让模型能以高精度还原空间关系,而不是靠模糊的文字提示反复试错。

文章配图

为什么“新视角预测”是关键

World Labs 联合创始人 Justin Johnson 在 a16z 的访谈中解释,大语言模型的基础是“预测下一个 Token”,视频模型的基础是“预测下一帧”,而 Atlas 的基础是“预测新的视角”。这个任务看似简单,实则要求模型真正理解空间的几何结构和物体之间的相对关系。

举个例子:如果你在房间四个角落各拍一张照片,传统重建方法需要这些照片覆盖所有表面,否则就会出现空洞。但现实中,总有拍不到的地方——桌子底下、椅子腿之间、植物叶片的缝隙。Atlas 的做法是:先用三角测量确定已被多视角覆盖的部分,再用生成能力合理补全未被拍摄的区域。这种“重建+生成”的混合机制,让它能用极少的输入(比如 3 到 25 张地面拍摄的照片)重建出斯坦福校园中央庭院的空中俯瞰视角。

Ben Mildenhall(NeRF 论文作者之一)指出,过去做三维重建必须“密集采集”——一个房间可能要拍几百张照片才能完整覆盖。这对普通用户来说几乎不可行。而 Atlas 把所需照片数量降到原来的几十分之一,使得大量已有素材(比如随手拍的旅游照、旧视频片段)都能被重新利用,变成可穿行的三维场景。

架构革新:多模态原生支持

Atlas 的另一个突破在于架构设计。它从预训练阶段就原生支持多种模态:文字、图片、视频、深度图,以及最关键的——相机位姿。这意味着模型不需要后期微调或额外模块,就能直接处理带空间信息的输入。

相比之下,World Labs 上一代模型 Marble 虽然也能生成三维世界,但输出被限制在“高斯泼溅”这一种表示形式上。高斯泼溅渲染效率高,适合 VR 和游戏引擎,但也成了瓶颈——所有生成内容都必须经过这一层转换,损失细节且难以扩展。

Atlas 改变了策略:它不再强制输出某种三维格式,而是专注于“新视角预测”这一基础任务。需要高斯泼溅时,它可以生成;不需要时,直接输出 RGB 图像或深度图即可。这种灵活性让模型能更好地随规模扩展——Justin Johnson 提到,他们已验证模型性能随参数量、训练时长和算力投入线性提升,当前版本只是受限于发布周期,远未达到架构上限。

创作者和机器人的共同需求

Atlas 的应用场景横跨创意产业和机器人领域。对创作者而言,它解决了长期痛点:保持多视角画面的空间一致性。过去,用不同 AI 模型生成同一房间的不同角度,常常出现家具位置偏移、门窗比例失调的问题。Atlas 通过空间上下文机制,确保所有生成视角都基于同一个隐式的三维结构,大幅减少后期修正工作。

更进一步,它有望简化三维设计流程。比如展会展位搭建、建筑可视化等场景,传统工作流依赖专业软件手动建模,修改一次可能耗时数天。如果设计师能直接上传几张参考图,再通过自然语言或草图指定修改(如“把沙发移到窗边”),AI 自动生成更新后的多视角画面,效率将极大提升。

在机器人领域,Atlas 的价值同样显著。World Labs 收购的机器人公司 Scenix 原本依赖密集重建将现实环境转为仿真场景,过程繁琐。现在,Atlas 能快速生成高保真仿真环境,用于训练机械臂等智能体。更重要的是,仿真环境需要“随机化”——比如电缆弯曲方向、箱子位置的变化——而 Atlas 可基于少量真实数据生成大量变体,解决机器人领域最缺的训练数据问题。

动态世界与可编辑性:下一步挑战

尽管 Atlas 已展示静态场景的惊人能力,但真正的“空间智能”还需处理时间维度。Justin Johnson 承认,动态模拟能力仍在开发中。不过,Atlas 架构本身已支持动态内容——部分演示视频中的水面波浪、移动车辆就是证明。团队策略是:预训练阶段混入动态数据,让模型学会分离静态结构与动态元素;当前版本侧重静态重建,后续将释放更多动态潜力。

另一大方向是“可编辑性”。Ben Mildenhall 强调,专业用户不仅需要高质量输出,还需要精确控制——比如指定场景中出现哪些物体、如何布局、何时发生事件。现有视频模型虽有初步编辑功能,但往往牺牲画质。Atlas 的目标是在不降低质量的前提下,提供类似“搭乐高”般直观的交互方式,让用户能随时修改生成的世界。

Fei-Fei Li 补充道,智能的本质是“观察-体验-交互”的闭环。Atlas 目前完成了观察和体验,下一步是让虚拟世界真正响应用户的操作,成为可行动、可规划的环境。

规模定律与算力瓶颈

团队对“规模定律”抱有坚定信念——更大的模型、更多数据、更长训练时间,必然带来性能提升。Justin Johnson 回忆,早期一个小规模实验模型成功生成花园桌子底部视角(包括一个真实存在的足球)时,三人立刻决定全力推进 Atlas。这证明新架构可行,且扩展路径清晰。

然而,当前主要瓶颈是训练算力。Fei-Fei Li 明确表示:“我们才刚刚开始。”发布版本并非技术极限,而是项目排期下的妥协。随着算力资源增加,模型规模有望继续扩大,进一步提升重建精度和生成质量。

结语

Atlas 的意义不仅在于技术整合,更在于重新定义了“世界模型”的可能性。它不再满足于生成孤立的画面,而是构建一个内部一致、可探索、可交互的虚拟空间。无论是三部手机复刻“子弹时间”,还是用旧照片重建童年故居,这些应用背后都是同一种能力:理解并重现我们所处世界的几何与逻辑。

这条路还很长——动态模拟、物理交互、实时编辑……但正如团队所说,他们已经跨过了最难的一道关:让生成的像素真正扎根于空间之中。