Orbis:Visko推出的实时视频生成模型,支持直播式交互

1 阅读

Orbis 是什么

Orbis 是 Visko 推出的第一个“实时世界模型”(Live Model),目标是让 AI 视频生成不再是一次性输出一段固定内容,而是像直播一样持续运转。你启动后,画面会不断推演下去,中途可以随时插话、改指令,系统会在一秒左右把新想法融入接下来的画面里。

Loomy

它不是预录再播放,也不是分段拼接,而是真正意义上的流式生成——每一帧都基于已发生的历史动态预测而来。目前支持 4K 分辨率、24 帧每秒的实时输出,并能在连续运行数小时后仍保持画面风格、角色外观和场景逻辑的一致性,不会出现常见的“漂移”或崩坏。

这种能力让它适合需要长时间、高互动性的场景,比如虚拟主播、可交互的故事体验,或者作为机器人在虚拟环境中的训练场。

核心功能:不只是生成,而是“活着”的视频

Orbis 的设计思路和传统文生视频工具很不一样。它不追求单次生成一段完美短视频,而是构建一个可以长期运行、随时干预的视觉世界。

  • 实时流式输出:一旦启动,视频就像直播信号一样源源不断输出,不需要等渲染完成。你可以一直看下去,也可以随时暂停、截取片段。
  • 生成中交互:在视频播放过程中,你可以输入新的提示词,比如“让主角穿上红色外套”或“切换到雨天”,系统平均 1 秒内就会让画面开始朝新方向演变。
  • 三种启动方式:支持纯文字生成视频、上传一张图作为起点(图生视频),或者给一段已有视频让它接着往下演(视频续写)。这三种模式底层共享同一套因果续写框架。
  • 长时一致性:很多视频模型跑几分钟就开始角色变形、颜色失真。Orbis 通过“有界多尺度记忆”机制,把近期细节保留高精度,远期信息压缩成紧凑状态,从而在小时级运行中保持稳定。
  • 物理真实感:物体移动、碰撞、重力表现更接近现实。这不是靠后期加特效,而是在生成过程中就引入了物理合理性约束。

这些功能组合起来,让 Orbis 更像是一个“可编程的视觉世界”,而不是一个视频制作工具。

技术原理:如何做到又快又稳还真实?

要实现真正的实时长视频生成,光靠堆参数不行,必须重构整个生成逻辑。Orbis 在几个关键环节做了创新。

因果时间分解:只看过去,不偷看未来

传统扩散模型在生成视频时,往往采用双向去噪——即同时参考前后帧来优化当前帧。这在离线生成中有效,但在流式场景下会出问题:未来的“噪声”可能污染当前决策,导致逻辑断裂。

Orbis 把视频生成看作一个“初值问题”:给定初始状态(比如第一帧或前几秒),模型只基于已发生的部分预测下一小段(称为一个 chunk)。这种因果结构天然匹配物理世界的马尔可夫特性——下一刻的状态只依赖于当前状态,而不是未来的幻想。

有界多尺度记忆:聪明地记住该记的

长时间运行最大的挑战是记忆爆炸。如果每帧都原样存下来,几小时后内存早就撑爆了。

Orbis 的解决方案是分层记忆:最近几十秒的数据保留原始潜在表示,保证细节;更早的历史逐步压缩;超出窗口的信息则被“固化”成一个固定大小的学习状态向量。这样,无论生成多久,内存和计算开销基本恒定。

物理感知奖励:让世界按规则运行

为了让生成内容不只是“看起来对”,而是“动起来合理”,Orbis 引入了一个冻结的 V-JEPA 2 潜在世界模型作为评判者。它会评估新生成的帧是否符合从历史状态预测出的动力学规律。

这个物理奖励和传统的视觉质量奖励(比如清晰度、美学)一起,通过 GRPO 强化学习联合优化生成器。结果就是,球会按抛物线落下,液体有粘滞感,人物转身不会穿模。

流式工程优化:从算法到硬件的全链路提速

光有算法不够,还得跑得快。Orbis 在推理阶段做了多项工程优化:

  • 状态复用:避免重复计算历史特征
  • 编译化 Transformer:将模型结构静态编译,减少调度开销
  • 多 GPU 序列并行:把长序列切分到多个 GPU 上流水处理
  • 渐进式解码-超分-传输流水线:低分辨率先出,高分辨率随后补上,实现 4K 实时交付

这些技术组合起来,才让 4K@24FPS 的实时生成成为可能。

怎么用?从 Playground 到 API

目前 Orbis 已在 Visko 官网开放 Playground,普通用户可以直接试用。

使用流程很简单:

  1. 开启会话:访问 Visko Models 页面,选择 Orbis,输入文字描述、上传图片,或粘贴一段视频开头。
  2. 启动 Live 模式:点击“Live”按钮,系统开始流式生成,画面像直播一样自动推进。
  3. 实时干预:在生成过程中,随时在输入框打字,比如“镜头拉远”“加入一只狗”,新指令会在下一个 chunk 边界生效,过渡自然。
  4. 调整画质:可选 1080p、2K 或 4K 输出,系统通过流式超分实时提升分辨率。
  5. 保存片段:点击“Clip”按钮,即可截取当前正在生成的任意长度片段,下载为 MP4。
  6. 集成到自有系统:开发者可申请 API Key,通过标准接口将 Orbis 嵌入自己的应用,比如虚拟主播后台、游戏引擎或机器人仿真平台。

值得一提的是,Orbis 支持“Morph the scene”这类高级指令,允许你描述场景的整体转变(如“从白天切换到夜晚”),系统会平滑过渡而非硬切。

和竞品比,Orbis 强在哪?

目前市面上也有其他实时交互视频方案,比如昆仑万维的 Matrix Game 3.0。但两者定位不同。

Matrix Game 3.0 更像一个 AI 驱动的游戏引擎,用户通过 WASD 键盘或鼠标操作角色,强调动作响应和空间探索,分辨率最高到 720P,帧率可达 40 FPS,适合做 AI 游戏。

而 Orbis 是通用视频世界模型,交互靠自然语言或图像提示,不依赖特定控制协议。它追求的是高画质(4K)、长时一致性和物理真实性,更适合影视级内容、虚拟人直播等对视觉质量要求高的场景。

简单说:Matrix Game 是“你操控角色”,Orbis 是“你描述世界,它自己演下去”。

实际应用场景

Orbis 的能力打开了不少新可能性:

  • 互动娱乐:想象一部电影,观众可以随时喊“让反派现在出现”或“切换到回忆片段”,剧情即时调整。这不再是分支叙事,而是真正流动的故事世界。
  • AI 虚拟主播:主播形象由 Orbis 实时生成,不仅能说话,还能根据弹幕改变背景、服装甚至情绪状态,无需提前录制大量素材。
  • 机器人仿真:在 Orbis 生成的高保真虚拟环境中训练机器人抓取、导航等任务,成本远低于真实场地,且可模拟极端或危险场景。
  • 教育演示:老师讲牛顿定律时,学生问“如果在月球上呢?”,系统立刻切换重力环境,实时演示物体运动变化。
  • 电商展示:虚拟模特在动态生成的客厅、户外等场景中展示商品,用户说“换个现代风格”或“展示防水效果”,画面马上响应。

这些场景的共同点是:需要长时间运行、高视觉质量、以及随时可干预的灵活性——而这正是 Orbis 的设计初衷。

局限与未来

当然,Orbis 并非万能。目前它主要面向英文提示,对复杂物理交互(如流体、布料)的支持仍在优化中。此外,虽然支持小时级生成,但极端长时间(如连续几天)仍可能累积误差。

不过,Visko 已在论文中透露下一步方向:引入音频生成与同步、支持多智能体交互、以及更精细的材质和光照建模。

总的来说,Orbis 代表了一种新范式——AI 视频不再是“制作-观看”的静态产物,而是一个可进入、可对话、可塑造的活世界。这或许才是生成式 AI 在视频领域的真正突破口。