具身智能新范式:Zeva如何实现冻结模型下的自进化因果学习?
近年来,具身智能(Embodied Intelligence)被视为通向通用人工智能的关键路径之一。然而,一个长期存在的瓶颈是:模型一旦部署到真实环境中,是否还能持续提升性能?传统方法依赖微调、在线学习或测试时训练(test-time training),但这些策略往往计算成本高、收敛慢,且容易破坏已有知识。而最新由清华大学智能产业研究院(AIR)与初创公司“域变换”联合发布的Zeva系统,提出了一种颠覆性思路——在完全冻结模型参数的前提下,实现能力的持续自进化。

这一突破的核心在于一种名为“In-Context Causal Learning”(ICCL,上下文因果学习)的新范式。Zeva并非通过梯度更新来适应环境,而是将每一次与物理世界的交互转化为可检索、可复用的因果证据,并将其嵌入模型的推理上下文中,从而动态调整行为策略。这种机制使得机器人在重复尝试中越用越强,甚至仅凭一次人类演示就能掌握新技能。
在标准具身基准RoboCasa365-Atomic5上,Zeva的平均任务成功率达到76.8%。更令人瞩目的是其自进化曲线:在四轮连续尝试中,累计成功率从最初的26%稳步提升至73%。而在真实化学实验室场景ChemLab-Evo中,三个基础操作任务(取试管、放置烧杯、倒水)的成功率同样呈现单调上升趋势,分别从65%→100%、25%→70%、30%→80%。这些结果均在模型权重完全冻结的条件下达成,彻底摆脱了对参数更新的依赖。
那么,Zeva究竟是如何做到这一点的?其技术架构围绕三个关键组件展开:因果交互编码器(Causal Transition Encoder)、双时标因果记忆(Dual-timescale Causal Memory)以及上下文策略注入(In-Context Policy Injection)。这三者共同构成了一个闭环的“感知-记忆-决策”系统,使模型能够在推理过程中动态整合历史交互经验。
首先,因果交互编码器负责从原始观测中提取“动作→状态变化”的因果信号。在每个时间步,系统接收视觉状态、动作指令和后续状态变化三类输入,并通过递归神经网络将其编码为紧凑的“因果交互状态”(Causal Interaction State)。该编码器在训练阶段通过多任务目标进行优化,包括预测状态变化、聚类任务类型以及估计任务阶段进度。这种设计确保了所提取的信号不仅包含表层动作信息,更蕴含了底层物理因果结构——例如物体质量、接触力、摩擦系数等隐变量的影响。
其次,双时标因果记忆机制解决了经验组织与复用的问题。Zeva将交互历史划分为两个时间尺度:Brief Interaction Trace(BIT)用于维持单次任务尝试内的连贯性,确保动作序列逻辑一致;而Persistent Interaction Memory(PIM)则跨多次尝试累积可迁移的经验。PIM中的每一条记录都以“因果交互信号”形式存储,包含任务上下文、动作、观察结果及其推断出的因果效应。当面对新任务时,系统会根据当前任务阶段和环境特征,从PIM中检索最相关的过往证据,构建一个结构化的因果提示(Causal Prompt)。
最后,上下文策略注入模块将这一因果提示无缝整合进冻结的动作生成模型(如Cosmos3)中。值得注意的是,Zeva并未修改生成模型的内部结构或损失函数,而是将因果提示作为条件输入,直接影响后续动作的采样分布。这种方式避免了引入额外噪声或破坏预训练知识,同时实现了对策略的动态调制。整个过程完全在推理阶段完成,无需任何反向传播或参数更新。
这种设计带来了显著优势。与传统的测试时训练方法相比,Zeva的响应速度更快、资源消耗更低,且不存在灾难性遗忘风险。更重要的是,它天然支持跨域因果迁移。实验表明,Zeva在仿真环境中学习到的因果关系可以有效迁移到真实机械臂上;不同任务中产生的等效物理效应(如“倾倒液体”或“推动滑动物体”)在因果信号空间中会自然聚类,形成可复用的知识单元。这意味着模型学到的不是具体任务的“操作步骤”,而是更本质的“物理作用机制”。
此外,Zeva还支持One-Shot Human Demonstration Enhancement。当人类操作员演示一次任务后,系统会自动将该次交互解析为因果证据并存入PIM。后续机器人在执行同类任务时,即可直接调用这一先验知识。量化结果显示,在“放置烧杯”任务中,人类warm-up可带来高达20个百分点的成功率提升;在“倒水”任务中也有15个百分点的增益。这极大降低了新任务的学习门槛,为实际应用场景(如实验室自动化、家庭服务机器人)提供了可行路径。
从理论层面看,Zeva重新定义了具身智能的Scaling法则。传统AI Scaling主要依赖数据量、参数规模和算力增长,而Zeva开辟了第四维度——交互次数。每一次与环境的互动都是一次“隐式系统辨识”过程:模型通过观察动作后果,逐步推断出当前物理系统的动态特性(如物体惯性、表面摩擦、关节限制等),并将这些信息压缩为高效的因果表示。随着交互经验的积累,模型对环境的理解越来越精确,策略也越来越鲁棒。
这种范式转变具有深远意义。过去,部署常被视为模型能力的“终点”——一旦上线,性能便趋于固定。而Zeva将部署变成了“起点”,每一次失败不再是噪声,而是可被结构化、可被检索、可被复用的宝贵证据。正如论文所言:“如果VLA是任务理解的基础设施,世界模型是经验想象的基础设施,那么ICCL就是现场因果学习的基础设施。”
展望未来,Zeva所验证的ICCL框架有望成为具身智能系统的核心组件。它不仅适用于机械臂操作,还可扩展至移动机器人导航、人机协作、工业质检等多个领域。更重要的是,它为解决“长尾任务”问题提供了新思路——无需为每个罕见场景单独收集数据和训练模型,而是让系统在实际运行中自主积累经验、自我完善。
当然,挑战依然存在。当前Zeva的因果记忆容量有限,如何高效压缩和检索大规模交互历史仍是开放问题;此外,在高度动态或非稳态环境中(如人群密集区域),因果结构可能频繁变化,对记忆更新机制提出更高要求。但无论如何,Zeva已经证明:智能体不必依赖参数更新,也能在真实世界中持续进化。这或许正是具身智能迈向“GPT时刻”的关键一步。