京东开源EchoWM:支持音视频同步生成的可交互世界模型

1 阅读

EchoWM 是什么

EchoWM 是京东探索研究院近期开源的一个交互式视听世界模型。它允许用户通过键盘操作(比如 WASD)在 AI 实时生成的虚拟环境中自由移动、转身或折返,同时画面、空间关系和声音(包括环境音、背景音乐、人物语音)会持续同步,即使经过多轮长时间交互,整体一致性也不会明显“跑偏”。

这个模型延续了 JoyAI-Echo 系列对原生音视频联合生成的支持,并在此基础上强化了交互能力。在官方公布的 WBench 导航评测中,EchoWM 在 158 个测试案例里平均得分 81.7,排名第一。

主要功能

EchoWM 的核心能力围绕“可进入、可探索、有声音”的 AI 世界展开:

  • 实时可探索世界生成:用户输入方向指令后,场景会动态展开,而不是预渲染好的固定片段。
  • 原生音视频联合生成:视频(720p)和音频(环境声、语音等)在同一框架内同步生成,声音随画面内容自然变化。
  • 双视角支持:既支持第一人称(镜头即观察者),也支持第三人称(镜头自动跟随人物或车辆等主体)。
  • 多轮长时程延续:以上一轮生成结果的末尾作为下一轮的上下文,确保场景布局、主体外观和声音风格在多次交互后仍保持连贯。
  • 评测表现领先:在 WBench Navigation 基准测试中,一致性与交互性指标均优于现有竞品。

技术实现细节

统一相机意图接口

传统做法往往为不同视角设计不同的控制逻辑,而 EchoWM 用一套统一的“相对6自由度(6-DoF)轨迹”来描述相机运动。具体来说,用户的 WASD 按键被映射为相对于初始位姿的连续运动轨迹。

  • 在第一人称模式下,这条轨迹直接代表观察者的移动路径。
  • 在第三人称模式下,模型通过训练数据自动学习“主体移动—镜头跟随”之间的耦合关系,无需额外提供角色轨迹或预设相机参数。

值得注意的是,轨迹信息只注入视频生成分支,音频则完全由画面内容驱动,实现自然联动。

世界数据引擎

为了训练出能应对多样场景的模型,团队构建了一个“世界数据引擎”,整合了四类数据源:

  1. 内部采集的游戏实机画面(gameplay)
  2. 人类玩家录制的真实操作录像
  3. Unreal Engine(UE)仿真的合成数据
  4. 普通互联网上的公开视频

这些数据的相机轨迹尺度差异很大。为此,团队采用“全局尺子”策略:以所有轨迹中最大平移幅度的第90百分位数作为归一化基准。这样既保留了不同轨迹间的相对位移差异,又避免了因分段定标导致的速度突变问题。

渐进式四阶段训练

模型训练分为四个阶段,逐步提升控制精度与生成质量:

  1. 音视频预训练:使用富含视听内容(AV-rich)的数据进行基础训练,建立基本的生成能力。
  2. 轨迹分支微调:冻结主干网络,仅训练轻量级的轨迹控制分支,强化对用户指令的响应。
  3. 联合微调:用高质量、高可控性的数据进行低学习率联合优化,平衡控制可靠性与视听质量。
  4. 自回归后训练:将模型改造为因果分块生成结构,结合 Teacher Forcing 和短时程 Self-Gradient Forcing,让模型学会基于自己生成的历史继续推理。最后通过分布匹配蒸馏,将采样步骤压缩至四步,并配合 sink-plus-FIFO 缓存机制,在控制显存开销的同时支持长时程流式交互。

如何使用 EchoWM

目前 EchoWM 已在 GitHub 开源,使用流程如下:

  1. 克隆代码库
    git clone https://github.com/jd-opensource/JoyAI-Echo
    cd JoyAI-Echo/echo_wm/
    注意:echo_wm/ 与长视频项目 echo_longvideo/ 是两个独立模块。

Loomy

  1. 创建 Python 环境

    conda create -n echo-wm python=3.11
    conda activate echo-wm
  2. 安装依赖: 先安装 PyTorch 2.9.1(CUDA 12.8 版本),再运行:

    pip install -r requirements.txt

    可通过 torch.cuda.is_available() 验证 GPU 是否可用。

  3. 下载模型权重: 使用 Hugging Face CLI 下载主模型:

    hf download Echo-Team/Echo-WM

    同时还需下载 Gemma 3 文本编码器(需先在 Hugging Face 页面接受许可并登录):

    hf auth login
    hf download google/gemma-3-...
  4. 运行示例验证: 官方提供了多个完整案例,例如:

    python scripts/run_wm_case.py --case examples/wm_cases/0010

    成功运行说明环境配置正确。

  5. 自定义生成: 调用 inference_wm.py,传入首帧图像、六字段提示词和动作指令串(Action DSL)即可生成带声音的视频。

  6. 编写动作指令: Action DSL 格式为 <按键>-<帧数>,多个动作用逗号连接。例如:

    • w-60,a-60:前进60帧,然后左移60帧
    • w-30,i-15,k-15:前进30帧,抬头15帧,低头15帧 支持的按键包括 w/s/a/d(前后左右)和 i/j/k(上下左右视角调整)。

核心优势

相比同类模型,EchoWM 的几个关键突破在于:

  • 真正的视听一体化:多数世界模型只生成画面,而 EchoWM 在同一框架内原生生成视频与多类型音频,且声音与画面事件严格同步。
  • 统一控制逻辑:一套接口同时支持第一人称探索和第三人称跟随,简化了交互设计。
  • 长时程稳定性:通过自回归后训练和缓存机制,多轮交互后仍能保持场景、主体和声音的一致性。
  • 评测领先:在 WBench 上得分 81.7,用户研究显示 63.13% 的参与者更偏好 EchoWM,远超 HappyOyster(27.06%)。

应用场景

虽然目前仍是研究原型,但 EchoWM 的能力指向多个实用方向:

  • 游戏原型快速验证:开发者可先进入 AI 生成的关卡试玩,评估空间布局、路线设计和镜头体验,再决定是否投入正式开发。
  • 互动叙事内容:剧情可根据用户选择动态分支并持续生成,替代传统预制素材,适用于互动剧、互动小说等。
  • 沉浸式广告或影视:观众不再只是“看”画面,而是可以“进入”其中自由探索,带来更强的参与感。
  • 低成本虚拟游览:博物馆、景区、房产样板间等场景可快速生成可漫游的数字版本,无需逐帧建模或拍摄。
  • 数字人协同表演:人物的语音、动作与动态环境、镜头运动、背景声音协同生成,适合虚拟主播或企业数字员工等场景。

与竞品对比

在当前的交互式世界模型中,EchoWM 与 HappyOyster 是主要对标对象。两者都支持音视频联合生成和实时交互,但 EchoWM 在几个关键维度上更进一步:

  • 视角控制:EchoWM 明确支持第一/第三人称双模式,且用统一接口驱动;HappyOyster 虽有“导演模式”和“漫游模式”,但具体控制接口未完全公开。
  • 长时程能力:EchoWM 通过自回归后训练和缓存机制显式优化了多轮交互的一致性;HappyOyster 对此细节披露较少。
  • 评测分数:WBench 平均分 81.7 vs 76.8,用户偏好度 63.13% vs 27.06%,差距显著。

总的来说,EchoWM 不只是“能动的画面”,而是一个具备空间感知、声音反馈和长期记忆的可交互世界雏形。虽然离大规模商用还有距离,但它为未来的人机交互提供了一个值得期待的方向。