AI落地物理世界困境:为何JEPA比生成式模型更具结构性优势?
人工智能(AI)正站在从纯粹的数字交互迈向复杂物理世界的关键转折点上。在ICML 2026的大会上,AMI Labs联合创始人兼首席研究创新官冯雁(Pascale Fung)指出了这一进程中的核心痛点:尽管大语言模型(LLM)在文本处理上展现了惊人的能力,但它们缺乏对物理现实世界的本质理解。要实现AI在现实世界中的有效部署,尤其是构建具备自主决策能力的智能体,构建高精度的“世界模型”已成为不可或缺的基础设施。
当前,AI智能体在物理世界的应用主要呈现为两大形态:一是嵌入智能眼镜等可穿戴设备中的主动式辅助智能体,它们共享人类的“第一人称视角”,提供过程规划与实时指导;二是部署在自动驾驶汽车或服务机器人中的执行智能体,需要将高层语义指令转化为精确的电机动作。尽管形态各异,这两类智能体的共同底座是对物理世界演化的预测能力。这种预测要求模型内化一套可进行因果推理的物理认知框架,而不仅仅是记忆静态图像或文本数据。
然而,现有的主流解决方案——大语言模型(LLM)和视觉语言模型(VLM)——在这一任务上存在根本性缺陷。LLM的训练数据主要来源于人类书写的文本,这意味着它们是以“二手”的方式学习世界。它们优化的是语言的流畅度和描述的优美度,而非物理世界的因果逻辑。因此,LLM难以预测重力、质量、摩擦力等真实的物理力,也难以处理嘈杂环境中的实际动力学变化。更致命的是,LLM基于生成下一个Token的目标,这必然导致“幻觉”问题。在文本生成中,幻觉或许只是无害的错误;但在物理世界中,如果机器人因幻觉而错误判断物体位置,后果可能是严重的碰撞事故。
数据进一步证实了LLM和VLM在物理推理上的不足。在DeepPhy、IntPhys 2、PhysBench等多个针对AI物理推理能力的基准测试中,人类的表现遥遥领先。例如,在评估基础物理和力学机制的DeepPhy基准中,人类准确率达64.7%,而最先进的通用大模型如Claude和Gemini Pro仅为41.2%和35.2%。在测试对象永恒性、时空连续性等直觉物理理解的IntPhys 2基准中,人类几乎完美,而生成模型的表现甚至低于人类的一半。这些数据表明,即便拥有万亿级参数,LLM仍未能跨越“落地差距”,它们懂得物理词汇,却不懂物理世界。
面对这一挑战,世界模型的构建路线出现了分野。一派是以Cosmos、Genie为代表的生成式世界模型,其哲学是“AI必须能生成每个像素才能理解世界”。这类模型通过预测下一帧视频像素来模拟世界,虽然能输出详细的像素流,但计算成本极高,且容易陷入对无关细节的过度拟合。另一派则是Yann LeCun与冯雁团队推崇的联合嵌入预测架构(JEPA)。JEPA的设计哲学截然不同:它不预测像素,而是预测未来世界状态和动作的抽象表征(Embeddings)。
JEPA的核心优势在于“抓大放小”。就像人类在观察世界时,会忽略不必要的细节而关注关键信息一样,JEPA模型将上下文和目标编码到潜空间,只预测与任务相关的抽象结构。这种机制使得JEPA模型在参数量、推理速度和鲁棒性上显著优于生成式模型。它不追求像素的完美重构,而是追求因果逻辑的正确性。在预测玻璃杯掉落时,JEPA不需要渲染玻璃杯看起来如何,只需理解其下落的物理必然性。这种对抽象空间的聚焦,使其对噪声和环境变化具有更强的适应性。
沿着JEPA这一技术脉络,AMI Labs团队取得了一系列突破性进展。早期的V-JEPA通过自监督学习在长达465年的视频数据上训练,获得了先进的视觉特征。随后的V-JEPA 2被用于机器人规划,能够在嵌入空间中进行过程规划,预测机械臂的运动轨迹。最新的LeWorldModel则是首个端到端稳定训练的JEPA模型,能够从原始像素直接训练,仅使用两种损失项就实现了高效的模型预测控制。这些工作证明了JEPA在自监督视觉表征学习和机器人动作规划上的领先地位。
除了自主系统,JEPA在可穿戴设备辅助智能体中的应用同样具有重要意义。可穿戴设备需要处理连续、嘈杂的第一人称视觉流,并具备长期记忆和心理模型(即理解用户意图)。生成式模型因计算量大、延迟高,难以满足此类设备的实时性和低功耗要求。为此,团队提出了视觉语言世界模型(VLWM)和VL-JEPA。VL-JEPA在语言空间中进行世界建模,将视觉输入和目标转化为语言描述,在嵌入空间中跟踪动作和状态。这种方法不仅参数量比经典VLM少50%,推理速度更快,而且具备“选择性解码”特性——只有在检测到有意义的事件时才进行解码,从而大幅降低能耗。
VL-JEPA的另一个突破在于其零样本动作跟踪能力。由于基于开放词汇的嵌入空间,VL-JEPA能够识别未见过的动作和状态,这对于可穿戴助手理解用户的新行为至关重要。例如,当用户试图制作复杂的菜肴时,VL-JEPA可以实时跟踪用户的每一个步骤,并在用户偏离计划或出现错误时提供主动指导。为了支持这一研究,团队开源了包含14.6年YouTube视频数据的Action 100M数据集,旨在推动社区对具身智能和主动式AI的研究。
尽管技术前景广阔,现实世界中的AI智能体也引发了伦理和安全方面的担忧。可穿戴设备和机器人始终处于开启状态,其收集的数据极度个人化,且可能捕捉到旁观者信息。此外,类人化的交互容易引发用户的过度信任和情感依赖,导致潜在的操纵风险。因此,在模型设计中引入防操纵机制、平衡用户参与度与隐私保护,是未来AI安全研究的重要方向。
综上所述,AI从数字空间迈向物理世界,关键在于从“生成”转向“理解”。JEPA路线通过预测抽象表征而非像素,提供了更具结构性优势的世界模型解决方案。它在物理因果推理、计算效率和鲁棒性上的表现,使其成为构建下一代自主智能体和可穿戴辅助系统的理想基石。随着LeWorldModel、VL-JEPA等工作的深入以及开源社区的推动,JEPA有望成为连接人工智能与物理现实的重要桥梁,推动具身智能进入新的发展阶段。