PhiZero突破性物理语言模型:AI如何学会真实世界的运动规律
近年来,人工智能在理解和生成人类语言方面取得了显著进展,但当AI进入现实物理环境时,仅凭自然语言是否足以支撑其认识复杂的真实世界?中科院自动化研究所的最新研究成果PhiZero为我们提供了全新的思路——通过构建物理语言系统,让AI学会理解真实世界中的运动、交互与变化规律。

物理语言:AI理解真实世界的新范式

传统的大语言模型通过学习人类书写的文字内容,掌握了概念表达和知识组织能力。然而,真实世界的复杂性远超文字描述的范畴。PhiZero从一个根本性问题出发:除了描述事物的文字,机器能否学习一套直接表征物理世界细粒度变化的符号系统?

物理语言的概念应运而生。这套系统专门编码对象如何移动、彼此如何作用,以及整个场景从一个时刻过渡到下一个时刻的方式。与传统的像素级表示不同,物理语言不会重复记录颜色、纹理等静态视觉细节,而是聚焦于动态变化的核心信息。

以倾倒液体为例,容器的形状与材质已经包含在首帧中,而倾斜、流出、扩散等动态过程则由物理语言承载。这种分工使得状态变化具备了复用的可能性,即便更换场景、材质或对象形态,原有的运动和交互规律仍可被保存并参与组合与迁移。

PhiZero的核心能力展示

视频生成与物理过程建模

PhiZero展现出令人印象深刻的能力,能够生成具有连贯物理过程的视频。无论是海水冲击岩石、液体灌入容器,还是物体坠入热油、金属罐发生爆炸,模型都可以对后续过程进行精确建模。其追求的不仅是每一帧的视觉逼真度,更重要的是动作产生的影响能够延续,整段事件在时间上保持完整性。

这种能力的关键在于模型对物理规律的深层理解。当网球碰到玩具鸭时,模型知道后者应当如何移动;当物体坠入滚烫的油中时,模型能够预测相应的液体响应;当金属容器爆炸时,模型可以准确模拟火光、碎片和投影随时间的共同变化。

跨形态运动迁移技术

在物理语言框架下,重点是变化本身而非执行变化的具体对象。基于这一特点,一段运动所对应的状态转移可以离开原始视频,被赋予新的外观、身体结构或视觉风格。

人体运动迁移是其中的典型应用。对于真人运动,PhiZero可以先抽取其中的状态变化,再让人形机器人呈现相应过程。这种迁移不依赖于成对的人类-机器人训练视频,展现了模型强大的泛化能力。类似的迁移也能发生在手部操作上,人手与物体接触、完成抓握及转动手腕的过程,可以在灵巧手上重新呈现。

更进一步,这种机制能够连接仿真域与真实域。模型保留仿真片段所包含的动作和交互,再以真实场景的初始外观为基础,生成对应的后续视频。

可控世界建模与交互探索

PhiZero具备接收持续输入、随时更新控制信号的能力。每当移动方向或观察视角发生改变,模型都会据此向前生成世界,同时努力维持环境布局、关键地标及空间关系的一致性。这种能力使得AI可以从单张图像出发,连续探索可交互的世界。
在驾驶场景中,面对相同的道路起始帧,不同控制轨迹应当导向不同结果。PhiZero会结合转向的方向与幅度生成相应未来,展现了其对因果关系的深刻理解。
技术架构:Reason-then-Render框架
PhiZero采用了独特的Reason-then-Render(先推理、后渲染)世界模型框架。这套框架由两个主要阶段构成:
首先是物理语言分词器将视频转写为物理语言。该组件识别连续世界状态之间的差异,并把这些差异编码成离散符号序列。由于场景和对象的静态外观由第一帧提供,视觉细节可以借助预训练扩散解码器恢复,因此数量有限的符号能够集中记录真正发生的动态变化。
其次是物理语言推理器在物理语言中预测后续事件。该组件接收当前图像与动作意图,按照自回归方式生成未来的符号序列;扩散解码器随后读取这些符号,将推理出的演化过程转换为视频。
整个生成过程可以理解为一条三段式链路:识别此刻的世界→推算后续的状态变化→绘制变化对应的视觉结果。
物理语言的高效性与压缩特性
物理语言对视频动态进行了高度压缩。一段4秒长、8FPS、分辨率为512×896的视频,在首帧之后仅需256个离散符号表示其状态演化;相比之下,标准视频VAE会使用44,800个连续视觉token。这种巨大的压缩比并没有牺牲生成质量,重建实验表明,即使符号数量大幅减少,模型依然获得领先质量。
这种高效性说明被压缩表示优先保留了与世界演化相关的信息,而不是反复存储静态外观。物理语言的紧凑性使其成为连接不同模态和任务的理想桥梁。
训练数据与学习过程
物理语言的形成同样需要从大量经验中学习。训练数据经历了逐层筛选过程。研究团队先对约5万小时真实世界视频进行去重、画质过滤和镜头级筛选,从中保留约1万小时未标注内容,用于训练物理语言分词器。
接下来,真实视频与仿真视频共同构成约500万个时长4秒的片段,帮助模型覆盖更多状态转移。最终,约100万个运动充分、物理事件明确的样本被进一步选出,用来提升物理语言推理器对世界演化的预测能力。
整个学习过程不需要人为规定某个符号必须表示特定的物理现象。通过不断压缩视频、还原画面并预测未来,模型自行发现哪些变化值得记录,又该如何将它们组织成连续事件。
性能验证与基准测试
研究团队从物理视频生成与物理事件理解两个方向对PhiZero进行了全面评估。在生成侧,PhiZero在Physics-IQ Verified、PhyGround、WorldModelBench三项基准中取得领先成绩,相关指标覆盖结果一致性、物理规律遵循程度以及整体世界建模水平。
相较于直接在像素空间生成视频的模型,PhiZero更准确地表现出碰撞引起的移动、重力造成的形变、连续触发的反应,以及随对象位置改变的阴影。在理解侧,PhiZero在IntPhys2、LikePhys、YoCausal三项测试中也达到领先或具有竞争力的表现。
模型可以把两段视频映射到物理语言空间并比较其合理程度,进而找出不符合直觉物理或因果逻辑的事件。这证明物理语言不仅是一种服务于生成的高效编码,也提供了评判现实中哪些事件更有可能发生的表示基础。
技术意义与未来展望
自然语言之所以强大,不仅因为它能给事物命名,更因为知识可以借助语言被抽象、重组、推导和传递。PhiZero希望把类似的能力带到对物理变化的表达之中。通过将连续的世界演化压缩成可传递、可推断的符号,使视频生成、物理理解、动作控制与运动迁移能够围绕同一个表示体系建立联系。
这项技术为AI打开了通往物理世界的新通道。面向未来,规模更大的训练数据、更强的模型以及跨度更长的预测,有望继续拓展物理语言的表达范围。它还可能支持多模态模型理解时空关系、帮助具身智能体制定计划,并推动技能在不同机器人形态之间迁移。
对AI发展的深远影响
PhiZero代表了AI理解能力的重要进步。如果说自然语言帮助AI读取人类记录的知识,那么物理语言则试图让AI读懂真实世界中的运动、交互与变化。这种双重理解能力的结合,将使AI系统具备更完整的现实世界认知。
在机器人领域,物理语言可以帮助机器人更好地理解环境动态,制定更合理的行动策略。在虚拟现实和游戏开发中,这种技术可以生成更加真实可信的物理交互。在科学研究中,物理语言可能成为分析复杂物理现象的新工具。
随着技术的不断发展,物理语言有望成为连接数字世界与物理世界的重要桥梁,推动AI系统在真实环境中发挥更大作用。这种从表面像素到深层物理规律的认知转变,标志着AI理解能力的一次重要跃升。
PhiZero的研究成果不仅展示了技术上的突破,更重要的是为AI认知科学提供了新的理论框架。通过让机器学习物理世界自己的语言,我们正在构建更加智能、更加适应真实世界的AI系统。