超越像素生成:JEPA如何重塑AI在物理世界的因果推理能力
物理世界的入场券:为何预测未来至关重要
人工智能正站在从虚拟数据向物理实体跨越的临界点上。在ICML 2026大会上,AMI Labs联合创始人兼首席研究创新官冯雁提出了一个核心命题:AI智能体要真正融入现实世界,必须依赖一种对物理演化具备预测能力的“世界模型”。这种能力不再局限于静态图像的识别或文本的生成,而是要求模型内化一套可进行因果推理的物理认知框架。
现实世界中的AI智能体主要分为两类形态。一类是嵌入智能眼镜等可穿戴设备的主动式辅助智能体,它们共享人类的第一人称感知场,负责过程规划与实时指导。另一类则是部署于自动驾驶或家务机器人中的执行智能体,需要完成从高层语义指令到细微电机动作的分层规划。尽管任务场景截然不同,但两者的共同基石是对物理世界演化的精准预测。无论是预判用户下一步动作以提供协助,还是推演机械臂轨迹以避免碰撞,这种预测能力远超出了传统大语言模型(LLM)的范畴。
当前,AI落地面临的最大障碍被称为“落地差距”(Grounding Gap)。尽管LLM和视觉语言模型(VLM)掌握了大量物理词汇,但它们通过人类文本间接学习世界,本质上是在学习“二手”知识。这种学习方式导致模型缺乏对重力、质量、摩擦力等真实物理力的直观理解。在DeepPhy和IntPhys 2等物理推理基准测试中,人类表现遥遥领先,而最前沿的大模型得分仍远低于人类水平,甚至接近随机猜测。这表明,仅靠优化语言流畅度或像素生成,无法让AI获得真正的物理直觉。
生成式路线的局限与JEPA的结构优势
针对世界模型的构建,目前学术界主要存在两派观点:生成式世界模型和联合嵌入预测架构(JEPA)。生成式模型(如Cosmos、Genie)遵循“理解即生成”的哲学,认为AI必须能够完整生成每一帧像素才能理解物理规律。这种方法通过自编码器或扩散模型预测下一帧图像,虽然能模拟出逼真的视觉效果,但在实际应用中存在显著缺陷。
首先,生成式模型需要处理海量像素数据,计算成本极高,推理速度慢,难以满足可穿戴设备或实时机器人控制对低功耗和快速响应的严苛要求。其次,生成像素意味着必须重构所有细节,包括那些与当前任务无关的噪声信息。在复杂多变的环境中,这种对像素完美的追求反而降低了模型对噪声和环境连续变化的鲁棒性。此外,生成过程固有的随机性容易引发“幻觉”,在物理执行中可能导致灾难性后果。
相比之下,JEPA路线追求的是“因果正确性”而非“像素完美”。JEPA不尝试预测具体的像素值,而是将上下文和目标编码到潜空间中,预测未来状态的抽象表征(Embeddings)。这种方法模仿了人类的认知机制:我们在观察世界时,会自动忽略无关细节,专注于任务相关的核心信息。通过预测抽象表征,JEPA模型能够剥离噪声,聚焦于物理世界的结构本质。
这种设计带来了显著的结构性优势。JEPA模型参数量更小,推理速度更快,且在面对环境变化时表现出更强的泛化能力。它不需要生成每一帧画面,而是直接在潜空间中进行规划和推理。例如,在机器人控制中,JEPA可以直接预测动作序列对状态的影响,而无需生成中间的视频帧。这种“理解”而非“生成”的模式,使得JEPA在物理世界的落地场景中展现出天然的优势。
从V-JEPA到VL-JEPA:技术演进与突破
冯雁团队在JEPA路线上取得了一系列标志性进展,包括V-JEPA、V-JEPA 2、LeWorldModel以及最新的VL-JEPA。这些工作逐步完善了JEPA在视觉表征、机器人规划和多模态理解方面的能力。
V-JEPA利用自监督学习在长达465年的视频数据上进行训练,成功提取了外观和运动的高级视觉特征。其衍生版本V-JEPA 2被应用于机器人规划,能够在嵌入空间中进行过程规划,预测机械臂的运动轨迹。LeWorldModel则实现了端到端的稳定训练,仅通过两种损失项就实现了高效的模型预测控制(MPC),展示了JEPA在直接操作原始像素方面的潜力。
然而,针对可穿戴智能体的特殊需求,团队进一步提出了视觉语言世界模型(VLWM)和VL-JEPA。可穿戴设备要求智能体具备“心理世界模型”能力,即理解用户的意图、目标和长期记忆,并能主动提供协助。传统的生成式模型无法在资源受限的设备上实时运行,而VL-JEPA通过将视觉信息编码为语言描述的动作空间,实现了高效的状态跟踪和动作预测。
VL-JEPA基于强大的V-JEPA 2编码器,能够在嵌入空间中实时跟踪开放词汇的动作和状态。它不采用自回归的方式逐Token生成,而是通过滑动窗口在嵌入空间中进行预测,仅在检测到有意义的事件时才进行解码。这种“有选择性地解码”机制大幅降低了计算开销,使模型在保持高性能的同时实现了节能。实验数据显示,VL-JEPA以少50%的参数达到了比经典VLM更高的性能,并在CVPR 2026 EgoVis行动识别挑战赛中夺冠。
主动智能与零样本泛化:迈向真正的具身AI
JEPA架构的核心价值在于其强大的零样本泛化能力。在可穿戴智能体的演示中,系统能够实时跟踪用户的动作(如制作黄油派),并在用户执行错误步骤时提供纠正,而忽略无意义的干扰动作(如喝水)。这种能力源于模型对动作本质的抽象理解,而非对具体像素模式的记忆。
此外,团队发布的Action-100M数据集和主动过程协助基准,进一步推动了该领域的标准化研究。这些工具使得智能体能够自动检测计划偏差,实现真正的主动协助。例如,在制作咖啡的场景中,智能体能根据用户的实时动作,动态调整下一步的指导策略,展现出高度的情境感知能力。
随着JEPA技术的成熟,其在自主系统和可穿戴设备中的应用前景广阔。通过构建任务无关的世界模型,并结合具体的成本函数进行策略生成,AI智能体有望在任何环境中实现零样本学习。这不仅解决了当前大模型在物理推理上的不足,也为构建具备长期记忆、个性化适应和主动交互能力的下一代AI智能体奠定了坚实基础。
尽管前景诱人,JEPA路线也面临挑战,如潜空间的可解释性以及与伦理安全的平衡。随着可穿戴设备采集更多个人数据,如何防止拟人化带来的过度信任和数据滥用,将是未来研究的重要课题。但可以肯定的是,从生成像素到预测表征的范式转变,正在引领AI走向一个更稳健、更智能的物理世界新阶段。