国产世界模型登顶李飞飞榜单:昇腾适配与全开源背后的技术突围
在人工智能视觉领域,世界模型被视为通往通用人工智能的关键拼图。近期,这一领域迎来了一个具有里程碑意义的时刻:由兔展智能团队联合北京大学、鹏城实验室共同研发的UniWorld-View模型,成功登顶由李飞飞团队建立的WorldScore基准测试榜单。这一成就不仅标志着中国团队在世界模型研发上达到了国际领先水平,更因其对国产昇腾算力的深度适配以及代码、权重的完全开源,引发了行业内的广泛关注与讨论。
世界模型的核心能力在于理解物理世界的三维结构与动态变化,并能够基于此进行推演与生成。UniWorld-View展现出的能力令人印象深刻:用户只需提供一张静态图片或一段随手拍摄的单目视频,模型即可生成具有指定相机轨迹的新视角视频。无论是推拉摇移的基础运镜,还是围绕场景360度旋转的复杂视角变换,模型都能提供精确且听话的相机位姿控制。这种“单图生3D、视频生4D”的统一处理能力,打破了传统方法在数据模态上的壁垒,真正实现了“Uni”(统一)的世界视图构建。
新视角合成(Novel View Synthesis)一直是计算机视觉领域的难点,尤其是在大基线(Large-baseline)条件下。所谓大基线,是指新视角与原始视角之间存在巨大的空间差异。例如,仅给AI看人物的正脸,要求它生成侧脸甚至后脑勺的画面。传统的神经辐射场(NeRF)和3D高斯泼溅(3DGS)技术依赖于多视角的重建逻辑,视角覆盖越全,重建效果越好。然而,面对视角稀疏的单目视频或单张图片,这些方法往往会产生大量的空洞伪影,甚至完全失效。
早期的生成式方法试图通过扩散模型来解决这一问题,但它们通常将相机位姿作为抽象的条件向量输入,缺乏显式的三维几何建模。这导致生成的视频在视角变化较大时容易出现结构漂移和失控。随后出现的第三条技术路线,尝试先利用几何模型将画面转化为3D点云,再将目标视角的点云渲染图作为条件输入视频扩散模型。虽然ViewCrafter和英伟达GEN3C等方法沿用了这一思路,但在实际研发中,团队发现点云渲染环节存在严重的“穿帮”问题,这成为了制约生成质量的关键瓶颈。
点云本质上是空间中孤立点的集合,缺乏连接信息和面朝向概念。当视角发生大幅转动时,渲染图像会出现两种典型的错误:一是前景与背景的撕裂,由于深度边界处缺乏连接信息,前景纹理会被错误地拉伸至背景,或背景像素糊到前景物体上;二是背面漏光,由于点云没有遮挡概念,相机绕到物体背后时,正面的点会直接透视过来,造成视觉上的逻辑混乱。在小幅度视角变换中,这些错误尚可通过生成模型的想象力进行修补,但在大基线条件下,错误的几何信号会严重误导扩散模型,导致结构扭曲和伪影频发。
针对这一痛点,UniWorld-View提出了“遮挡感知点云渲染”技术,通过两招关键算法彻底清理了条件图中的错误信号。第一招是双重投影(Double-Reprojection),专门解决前景背景撕裂问题。该方法将源画面投影到目标视角,再反向投影回源视角。凡是无法正确返回的像素,即被判定为遮挡区域。系统将这些区域沿相机轨迹逐帧累积成遮挡掩码(Mask),在渲染时直接剔除,留出空白区域交由生成模型进行合理补全,从而避免了错误纹理的误导。
第二招是法向过滤,旨在解决背面漏光问题。通过估算每个点的法向量,并计算其与视线方向的夹角,系统能够识别并剔除背对相机的点。经过这两步处理,输入给扩散模型的条件图不再包含错误的几何信息,而是保留了可靠的几何结构以及明确的待补区域。这种“诚实”的条件输入,使得生成模型能够专注于内容填充而非纠正几何错误,显著提升了生成结果的真实感与一致性。
在解决了几何一致性问题后,如何平衡构图准确性与外观真实性成为下一个挑战。点云渲染图虽然位置准确,但内容缺失;而源视频内容完整,却与新视角位置不匹配。UniWorld-View采用了创新的“双流条件注入”架构来应对这一矛盾。其中,“几何流”负责将点云渲染图和掩码编码后加入潜变量,确保生成内容严格遵循三维结构约束;“外观流”则通过新设计的Ref-DiT模块,利用交叉注意力机制,让模型从源视频中提取特征,对新视角下的缺失部分进行精准修补。这种分工明确的机制,既保证了空间的合理性,又维持了视觉的一致性。
更进一步,UniWorld-View实现了从新视角合成到4D重建的自然延伸。既然模型能够任意切换机位,那么通过生成多个不同角度的视图,单目视频便转化为多视角视频,进而使得动态3D高斯泼溅(4DGS)重建成为可能。与传统方法将空间变换与时间推进耦合不同,UniWorld-View采用了解耦策略:首先冻结时间,生成第一帧的静态环绕视图作为外观锚点;随后在固定机位上生成同步的多视角视频,并利用静态锚点进行对齐。这种分步走的策略有效解决了前景自遮挡问题,最终通过4DGS优化,实现了从单目随手拍到可自由漫游的4D动态场景的全流程打通。
这一技术突破的背后,是兔展智能在视觉AI大模型领域的长期深耕。作为一家由北京大学校友及视觉领域青年领军人才创立的企业,兔展智能始终坚持底层技术的自主研发。其此前发布的Open-Sora Plan是全球首个开源文生视频模型,代码引用量曾位居全球第一。而UniWorld系列模型则率先探索了理解与生成的统一架构,UniWorld-V2早在2025年便已发布,引领了行业方向。此次UniWorld-View的登顶,不仅是技术实力的体现,更是国产AI生态成熟的重要标志。
值得注意的是,UniWorld-View全面适配国产昇腾算力,这对于推动我国人工智能基础设施的自主可控具有重要意义。在当前全球算力竞争日益激烈的背景下,能够在国产硬件平台上实现世界级的模型性能,证明了国产软硬件协同优化的巨大潜力。同时,代码与权重的完全开源,降低了学术界和产业界的研究门槛,有助于加速世界模型技术的普及与创新。
从技术演进的角度来看,UniWorld-View的成功表明,单纯依靠扩大数据规模或增加模型参数已不足以带来质的飞跃,深入理解物理世界的几何规律,并将其与生成式AI的概率推理能力有机结合,才是突破当前瓶颈的关键。遮挡感知渲染与双流架构的设计,为后续研究提供了宝贵的参考范式。
随着视觉AI大模型能力的不断产品化,如即将推出的RabbitVis产模一体设计生产工具,这项技术有望迅速进入商业设计工作流,改变视频创作、虚拟现实、数字人交互等多个行业的工作方式。从实验室的算法突破到产业界的实际应用,UniWorld-View展示了一条清晰的技术落地路径。
综上所述,UniWorld-View在WorldScore榜单上的登顶,并非偶然。它是几何建模与生成式AI深度融合的产物,是国产算力与先进算法协同优化的成果,也是开源精神推动技术进步的典范。在未来,随着世界模型对物理世界理解的不断深化,我们有理由相信,更加真实、可控且高效的虚拟内容生成将成为现实,为数字经济的蓬勃发展注入新的活力。这一突破不仅属于研发团队,更属于每一个致力于推动人工智能向前发展的从业者。