昇腾算力加持!UniWorld-View开源:单图生成4D世界的新范式

3 阅读

在计算机视觉领域,构建“世界模型”一直是通往通用人工智能(AGI)的关键一步。近期,由李飞飞团队维护的WorldScore榜单发生了重要更迭,国产技术力量迎来高光时刻。兔展智能联合北京大学、鹏城实验室共同研发的UniWorld-View模型正式登顶榜首。这一成就不仅标志着该模型在单图及单视频生成多视角视频任务上的卓越表现,更因为其全面适配国产昇腾算力且核心代码权重全开源,为国内AI基础设施与算法创新的双轮驱动提供了坚实样本。

UniWorld-View的核心突破在于其“统一”特性:无论是单图3D生成还是视频4D生成,均基于同一套代码与模型架构。用户仅需提供一张图片或一段随手拍摄的视频,模型即可生成相机轨迹可控的高质量新视角视频。这种“推拉摇移”乃至360度环绕的精确位姿控制能力,重新定义了内容创作的交互边界。然而,实现这一愿景的背后,是对传统几何重建与生成式方法局限性的深刻洞察与技术重构。

突破大基线难题:从“重建”到“生成”的范式迁移

新视角合成(Novel View Synthesis, NVS)的本质,是要求AI具备“脑补”未拍摄角度的能力。在传统视图中,NeRF(神经辐射场)和3DGS(3D高斯泼溅)等基于重建的技术遵循“看得越多,建得越准”的逻辑。然而,在单目视频或单图场景下,视角覆盖极其有限,强行重建往往导致空洞、伪影甚至完全失效。

生成式方法虽然具备想象力,但早期模型常将相机位姿抽象为条件向量注入扩散模型。这种缺乏显式3D结构约束的方式,导致模型在大幅度视角转换时容易失控,出现结构扭曲。为了解决这一矛盾,业界逐渐转向“几何引导+生成优化”的混合路线:先利用几何模型构建3D点云作为基础结构,再将目标视角的点云渲染图作为条件输入视频扩散模型。ViewCrafter、英伟达GEN3C等均采取了类似策略。

尽管这一路径显著提升了相机控制的准确性,但研发团队发现,点云渲染环节存在一个长期被忽视的隐蔽缺陷:由于点云是离散的孤立点集,缺乏面片连接信息与法向连续性,在大基线视角切换时极易出现两种典型的“穿帮”现象。

技术攻坚:遮挡感知点云渲染与双重修复

第一种穿帮表现为“前景背景撕裂”。在深度边界处,由于缺乏连接信息,当视角发生剧烈变化时,前景纹理会被错误拉伸至背景,或背景像素强行覆盖前景,产生类似口香糖拉伸的视觉失真。第二种穿帮则是“背面漏光”。由于点云没有明确的“前后”遮挡关系,当相机绕至物体背面时,正面的点会直接穿透显示,导致观察者仿佛能隔着后脑勺看到人脸,严重破坏了场景的物理真实性。

小幅视角变化时,这些瑕疵尚可被生成模型通过模糊处理掩盖;但一旦进入大基线场景,错误的几何信号将直接误导扩散模型,导致最终生成结果结构崩塌。针对这一核心痛点,UniWorld-View提出了“遮挡感知点云渲染”(Occlusion-aware Point Cloud Rendering)方案,通过两招精准修复。

第一招是“双重投影”机制,专门解决撕裂问题。该机制将源画面投影至目标视角,再反向投影回源视角。通过对比两次投影的结果,系统能精准识别出“无法回流”的像素区域,这些区域即被标记为遮挡区。随后,算法沿相机轨迹逐帧累积生成遮挡掩码(Occlusion Mask)。在渲染阶段,这些被标记的区域被直接挖空,而非填充错误的纹理。这种“留白”策略将补全任务交给生成模型,避免了错误几何信号对扩散过程的干扰。

第二招是“法向过滤”,旨在消除背面漏光。算法为点云中的每个点估计法向量,并计算其与视线方向的夹角。任何背对相机的点均被判定为无效并剔除出渲染序列。这两项技术组合拳,彻底清除了条件图中的错误几何信号,保留了可靠的几何框架与明确的待补区域,为后续的高质量生成奠定了坚实基础。

双流架构:构图与上色的解耦与协同

几何结构的理顺仅是第一步,UniWorld-View面临的第二个挑战是如何协调“几何正确但内容缺失”的点云渲染图,与“内容完整但几何偏差”的源视频之间的矛盾。模型最终采用了“双流条件注入”架构,实现了构图与上色的分工协作。

在“几何流”中,点云渲染图及其对应的遮挡掩码经过编码后直接注入潜变量空间。这一分支的作用类似于“骨架”,负责将生成内容死死锁定在3D结构之上,确保新视角的空间一致性。而在“外观流”中,团队设计了创新的Ref-DiT模块。该模块采用交叉注意力机制,以新视角特征作为查询(Query),以源视频特征作为键(Key)和值(Value)。这种机制允许模型像“寻宝”一样,从源视频中检索并迁移纹理信息,自动修补因点云伪影造成的纹理缺失,确保生成结果在材质、光影上与源视频高度一致。

这种“一个管构图,一个管上色”的设计,不仅提升了生成质量,还增强了模型对复杂场景的鲁棒性。

4D重建解耦:从单目漫游到多视角闭环

UniWorld-View的价值不仅限于视觉生成,更在于其打通了从单目视频到4D动态场景重建的全链路。理论上,若能任意变换相机位姿,单目视频即可转化为多视角视频,进而通过多视角3D高斯泼溅(4DGS)实现高质量动态场景重建。

然而,常规生成式方法中,相机运动与时间推进往往耦合在一起,导致4D空间内的视角分布极度不均匀,难以进行稳定的4D重建。UniWorld-View通过独特的“两步解耦”策略解决了这一难题。

第一步是“定妆照”生成:模型将时间轴冻结在第一帧,围绕场景生成一圈静态环绕视图。这些视图作为整个场景的外观锚点,确保了空间几何的一致性。第二步是“动态拍摄”:在固定的多机位设置下,生成同步的多视角视频。每个机位的第一帧均与“定妆照”严格对齐,而前景物体在运动中的自遮挡问题,则通过迭代生成逐步补全。

经过这两步处理,原本单轴的随手拍视频被转化为空间分布均匀的多视角视频序列。此时,将其输入4DGS优化器,即可获得最终的4D场景模型。这一流程实现了“单目随手拍→可自由视角漫游的4D场景”的无缝闭环,极大地降低了高质量3D内容生产的门槛。

国产算力适配与开源生态的双赢

UniWorld-View的另一大里程碑意义在于其对国产昇腾算力的全面适配。在当前的国际技术环境下,算力自主可控不仅是战略需求,更是技术落地的现实保障。兔展智能作为由北京大学视觉领域青年领军人才联合创立的企业,其技术底座本身就强调底层自研与多模态大模型能力的积累。

此次UniWorld-View的成功,验证了国产算力芯片在运行大规模视觉生成模型时的可行性与高效性。同时,代码与权重的全开源策略,不仅加速了学术界的迭代研究,也为产业界的应用落地提供了现成的解决方案。此前,兔展智能发布的Open-Sora Plan已在全球代码引用量上位居第一,而UniWorld系列则进一步探索了理解与生成统一架构的前沿方向。

从2025年的UniWorld-V2到2026年的UniWorld-V2.5,该团队持续在理解生成一体化方向发力,并在图文交错、密集文字生成等复杂场景下缩小与国际顶尖模型的差距。随着产模一体工具RabbitVis的即将推出,视觉AI正加速从实验室走向商业设计工作流,为内容创作、数字人、游戏开发等领域带来革命性的效率提升。

UniWorld-View的登顶,不仅是算法指标的胜利,更是中国AI团队在基础模型研发、算力适配及开源生态建设上综合实力的体现。它证明,通过创新的架构设计与对底层问题的深入剖析,完全可以在国际主流榜单上建立起具有自主知识产权的技术高地。