告别像素幻觉:JEPA如何以因果推理重构物理世界AI
人工智能从数字虚拟空间向物理现实世界迁徙的进程中,面临着一个核心悖论:我们在语言和视频生成上取得了惊人的成就,但在理解物理规律和执行实际动作上却显得笨拙不堪。在ICML 2026大会上,AMI Labs联合创始人兼首席研究创新官冯雁教授提出,要让AI智能体真正融入现实世界,世界模型不仅是辅助工具,更是不可或缺的底层能力底座。这一观点直指当前AI研究中的痛点:为什么擅长处理文本的大语言模型(LLM)无法胜任需要处理物理交互的任务?答案在于对“世界”理解方式的根本差异。
现实世界中的AI智能体主要分为两类形态。一类是嵌入可穿戴设备(如智能眼镜)的主动式辅助智能体,它们与人类共享第一人称感知视角,旨在进行过程规划和实时指导。另一类是部署于自动驾驶或机器人系统中的执行智能体,需要将高层语义指令分解为电机层面的细微动作。尽管应用场景迥异,两者共享同一个核心需求:对物理世界演化的预测能力。这种预测并非简单的图像识别或文本补全,而是要求模型内化一套能够进行因果推理的物理认知框架。
当前主流的技术路线中,生成式世界模型占据着重要位置。这类模型(如Cosmos、Genie)认为,AI要理解世界,就必须能够完整地生成每一个像素。它们通过预测下一帧视频像素来模拟世界演化,依赖自编码器和扩散模型,从数百万小时视频中学习。这种设计哲学的核心假设是:通过重建视觉细节,模型可以自然习得碰撞、质量、动量等物理直觉。然而,这种对“像素完美”的追求在物理世界中带来了巨大的结构性缺陷。生成模型需要庞大的算力支持,推理速度缓慢,且对噪声和环境连续变化的鲁棒性较差。更关键的是,它们往往陷入局部最优,生成的画面可能在视觉上逼真,却在物理逻辑上荒谬。
与生成式路线相对,由Yann LeCun提出的联合嵌入预测架构(JEPA)提供了一条截然不同的路径。JEPA不试图生成视频或预测下一帧的像素值,而是专注于预测未来世界状态在潜空间中的抽象表示。它将上下文和目标编码到嵌入空间,利用预测器根据动作推断目标的表征。在这个过程中,模型舍弃了不可预测或无关的细节,只保留任务所需的因果结构。
JEPA的设计哲学是“预测重要信息,忽略无关信息”。就像人类进入房间时,并不会关注墙面上每一粒灰尘的像素变化,而是关注屏幕、人物和文字等关键信息。这种机制使得JEPA模型在参数量上远小于生成式模型,推理速度更快,且在面对物理世界的噪声和干扰时表现出显著更强的鲁棒性。在机器人动作规划中,JEPA直接在潜空间中进行规划和推理,能够更准确地建模物理环境的动力学特性,而无需陷入像素重构的计算泥潭。
为了量化这种差异,我们可以参考一系列物理推理基准测试的结果。在DeepPhys基准测试中,评估基础物理和力学机制时,人类表现优异,而包括Claude、Gemini Pro和GPT-4o在内的通用大模型,表现甚至仅略高于随机水平。在IntPhys 2基准中,测试对象永恒性、时空连续性等物理原则,生成模型得分依然低迷。即便是在PhysBench这样包含多模态数据的基准测试中,人类表现接近完美,而视觉语言模型(VLM)的平均得分仅为50%左右。这些数据清晰地表明,LLM和VLM虽然掌握了大量关于物理世界的词汇和描述,但并未真正“理解”物理规律。它们面临着一个巨大的“落地差距”:懂物理的词汇,却不懂物理的运作。
JEPA路线的突破在于其从生成内容转向了表征学习。AMI Labs团队基于这一理念,相继推出了V-JEPA、V-JEPA 2、LeWorldModel和VL-JEPA等一系列标志性工作。V-JEPA通过在465小时总时长的视频上进行自监督学习,预测掩码嵌入,获得了在外观和运动特征提取上最先进的视觉表征。V-JEPA 2进一步应用于机器人规划,能够在嵌入空间中预测机械臂从初始状态到目标状态的完整运动轨迹,实现了高效的过程规划。
特别是在面向可穿戴设备的AI智能体场景中,JEPA的优势尤为明显。可穿戴设备对计算效率、功耗和实时性有着极其严苛的要求。生成式世界模型由于其复杂的像素生成过程,无法满足设备端的低延迟和高能效需求。为此,团队提出了视觉语言世界模型(VLWM)和VL-JEPA架构。VL-JEPA基于V-JEPA 2编码器,在语言空间中进行世界建模,而非在像素空间。它将视觉输入和文本查询编码到公共嵌入空间,通过滑动窗口跟踪动作和状态。这种非生成式的机制消除了自回归解码带来的延迟,实现了真正的实时动作跟踪。
VL-JEPA的关键创新在于“有选择性地解码”。模型并不时刻输出结果,而是在检测到有意义的事件变化时才进行解码输出。这种机制在保持输出质量的同时,将解码操作减少了约2.85倍,极大地提升了能效。此外,VL-JEPA具备开放词汇能力,能够实现零样本的动作跟踪和状态评估。例如,在制作食物的场景中,智能体不仅能理解高层指令,还能实时跟踪用户的每一个细微动作,识别出哪些是有效操作,哪些是无关干扰(如喝口水),并据此调整后续的指导策略。
为了支持这一技术路线的研究,AMI Labs开源了Action-100M数据集,包含120万个视频和1.47亿个层次结构动作,为学界提供了丰富的训练资源。同时,团队还发布了主动过程协助基准和架构,使智能体能够自动检测计划偏差,实现从被动响应到主动协助的转变。这种主动式AI不仅理解物理动作,还能通过“心理世界模型”推断用户的意图、偏好甚至情绪状态,从而提供更具人性化和社会适应性的辅助。
尽管JEPA路线展现出巨大的潜力,但现实世界智能体的部署仍面临伦理和安全挑战。可穿戴设备和机器人始终开启的传感器可能侵犯隐私,而类人交互可能引发用户的过度信任或情感依赖。因此,在模型设计中平衡用户参与度与防操纵机制,建立行为护栏,是AI迈向现实世界必须跨越的第二道门槛。
从生成像素到预测表征,从语言描述到物理因果,AI研究范式正在经历一场深刻的变革。JEPA及其衍生架构不仅在技术上证明了“理解”优于“生成”在物理世界中的有效性,更为构建真正具身、智能、可靠的现实世界AI智能体提供了可行的技术路径。随着学术生态的不断丰富和数据资源的开源,这一方向有望加速AI从实验室走向千行百业的物理空间。