生数科技发布 Vidu S2:支持实时编辑、动态参考图与 VR 头显适配
Vidu S2 发布:两个模型,三种能力
9 月 15 日,生数科技正式推出 Vidu S2 视频大模型系列。这次不是单个模型,而是拆成两个明确分工的版本:Vidu S2-Avatar 负责生成可交互的数字角色,Vidu S2-Editing 专注对输入视频流做实时修改。两者都支持在运行过程中动态加入新的参考图像——比如中途让角色换件衣服、拿起杯子,或者把背景换成海滩。
更特别的是,这两个模型现在都能输出适配 VR 头显的空间视频。Avatar 生成的角色可以直接转成左右眼视图;Editing 则既能先改普通视频再转立体,也能直接处理已有的空间视频。这意味着你戴上头显后看到的 AI 角色或编辑画面,是真正有景深感的。
整个项目由朱军教授团队的博士生张金涛牵头,聚焦“流式”视频生成——不是一次性出一段固定视频,而是像直播一样持续输出,还能随时插指令调整内容。
Avatar:不只是说话,还能跳舞、换装、拿东西
Vidu S2-Avatar 的核心突破在于“持续交互”。你上传一张角色图,然后通过文字或语音发指令,它就能实时驱动角色做出反应。上一代主要处理说话时的口型和微表情,这一代明显放开了动作幅度——比如“跳一段街舞”或“挥手打招呼”,模型能更准确地跟上。
关键改进是动态参考图机制。过去这类模型一旦开始生成,就很难中途改变设定。现在你可以在视频播放到第 10 秒时,突然上传一张咖啡杯图片,说“拿起这个杯子”,角色就会伸手去拿,而且手和杯子的位置关系基本合理。同样,你也可以上传一件新衣服或一个新房间,让它立刻换装或切换场景。
为了保证动作连贯性,团队引入了视觉反馈机制。比如你说“拿起杯子然后微笑”,系统会先检查杯子是否真的被拿起来了,再决定要不要触发微笑。这避免了常见问题:角色嘴上说拿杯子,手却空着,或者动作做到一半断掉。
画质也从上一代的 540P 升到 720P,虽然离高清还有距离,但对实时流式输出来说已经算实用级别。
Editing:四类实时编辑任务,边播边改
Vidu S2-Editing 的定位完全不同——它不生成新角色,而是对已有视频流做实时修饰。你给它一段摄像头拍的视频(比如你自己坐在桌前),再配上文字指令和可选参考图,它就能一边接收新画面,一边同步修改。
目前支持四类操作:
- 风格迁移:保留你的姿势、脸型和房间布局,但把画面变成油画、水彩或赛博朋克风;
- 虚拟试穿:上传一件衣服照片,模型会把它“穿”到你身上,处理好衣袖遮挡手臂、布料随动作拉伸等细节;
- 人物替换:用参考图里的人脸、发型、服装整体替换视频中的人物外观,但保留你原来的动作和走位;
- 背景替换:换掉你身后的墙或窗外景色,即使你站起来走动,新背景也能保持空间稳定,不会出现“人往前走,背景却贴脸上”的错位。
这些编辑不是事后处理,而是实时生效。你抬手、转身、靠近镜头,修改后的画面会同步变化,延迟控制在可接受范围。
空间视频:为 VR 头显铺路
生数科技这次特意打通了空间视频链路。S2-Avatar 生成的 720P 视频会经过一个转换模块,输出左右眼两路信号,形成具有深度感的画面。S2-Editing 则更灵活:你可以先用它编辑普通单目视频,再转成立体格式;也可以直接喂给它已有的空间视频(比如用双摄拍的),它照样能做风格迁移或换背景。
所有结果都能通过流式传输推送到 VR 头显。目前体验版支持固定视角——你不能在虚拟空间里自由走动,但至少能看到一个有前后层次的 AI 角色站在面前说话或跳舞。
团队坦言,这还只是初步探索。下一步要解决两个硬骨头:一是提升头显端的清晰度(现在 720P 分到左右眼后分辨率更低),二是进一步压低延迟,否则快速转头时画面跟不上会晕。
技术底座:怎么做到又快又稳?
Vidu S2 能实现实时交互和编辑,背后有几项关键技术支撑。
首先是 Self-Replay Forcing(SRF)训练法。传统视频生成模型容易在长序列中累积小误差,导致角色脸慢慢变形(身份漂移)或动作卡顿。SRF 的做法是:先让模型自己生成一段较长视频,然后从中随机截取连续片段,重新加噪后再让它“重放”这段,通过反向传播修正错误。相当于让模型反复回看自己的录像找 bug,从而提升长期一致性。
数据方面,团队专门收集了大量舞蹈视频——既要动作丰富(大跳、旋转),又要画面稳定(避免抖动模糊)。标注也不只是打标签,而是用自然语言描述事件发生的先后顺序,比如“先抬右手,再转圈,最后定格 pose”。配合偏好奖励机制,让模型学会生成更符合人类预期的动作流。
S2-Avatar 还内置了一个 VLM(视觉语言模型)智能体作为质检员。它会实时分析当前帧是否完成了上一条指令(比如“杯子是否被拿起”),如果没完成,就自动调整下一轮的提示词,而不是盲目继续。
性能优化上,团队没堆参数,而是用轻量级单步 Refiner 在最后一步恢复高清细节,避免全程高分辨率计算。同时结合 TurboDiffusion(加速扩散过程)和 TurboServe(模块共享时间线调度),把各组件的计算资源协调起来,减少冗余开销。
评测结果:多项指标领先
在公开测试中,Vidu S2 表现不俗。S2-Avatar 在 StreamAV-Bench 评测里拿下全部 9 项第一,包括音画同步、面部稳定性、背景一致性等。S2-Editing 在 OpenVE 与 RefVIE 联合测试中得分为 4.26(满分 5),在 Sparkle-Bench 各项指标也排第一。在专门针对虚拟试穿的 ViViD 测试和多轮人工偏好对比中,它明显优于其他同类模型——尤其在处理复杂遮挡(比如手插进衣袖)和材质反光(丝绸、皮革)时更真实。

不过要注意,这些优势目前集中在特定任务上。比如人物替换要求参考图和源视频的姿态差异不能太大,否则容易扭曲;背景替换在快速运动时仍有轻微抖动。团队表示后续会通过更多数据和算法迭代来修补。

下一步:全景空间视频是难点
生数科技在发布时提到,当前的空间视频输出还是“固定视角”——你在 VR 里只能原地看,不能绕着角色走一圈。要实现真正的全景交互,需要模型能实时生成 360 度一致的画面,这对算力和算法都是巨大挑战。
另一个瓶颈是延迟与画质的平衡。现在 720P 输出到头显后,实际观感接近 480P,而用户对 VR 清晰度的要求远高于手机屏幕。如何在不显著增加延迟的前提下提升分辨率,是工程上的关键攻坚点。
短期来看,Vidu S2 更可能先落地在虚拟主播、在线试衣、远程协作等场景。比如电商客服用 Avatar 实时回答问题并展示商品,或者设计师用 Editing 快速预览服装上身效果。VR 适配算是提前布局,等硬件和网络条件成熟后再放大招。
目前 Vidu S2 已开放体验入口(https://vidu.com/vidu-stream),开发者可以申请 API 接入。对于普通用户,或许很快就能在直播或社交 app 里见到这类“边说边变”的 AI 角色了。