shengshu-ai/Vidu-S

Vidu S: Real-Time Interactive, Editable, and Spatial Video Generation

解决的问题

Vidu S 是一套实时互动视频生成模型,旨在克服高分辨率视频流相关的延迟和稳定性问题。它能够创建高保真数字角色、实时视频编辑,以及可实时响应用户指令的沉浸式空间视频。

工作原理

该项目包含两个主要版本:

  • Vidu S1:用于语音控制数字角色的模型,以最高 42 FPS 生成 540p 视频,支持自定义角色和语音语调。
  • Vidu S2:高级版本,将功能扩展到 720p 交互式虚拟人(25–42 FPS),并可实时编辑输入的视频流。

Vidu S2 采用一种称为 Self-Replay Forcing (SRF) 的技术,防止跨流段的错误累积,确保长期稳定性。在性能方面,它使用优化的服务堆栈(TurboDiffusion 和 TurboServe),具有低位 GEMM 和多 GPU 流水线,可在低成本 GPU 上运行。

适用对象

需要实时、交互式视频生成技术的开发者和创作者,用于数字人、VR/AR 沉浸式显示,以及实时视频风格迁移或角色替换。

亮点

  • 实时交互式虚拟人:以 25-42 FPS 生成 720p 视频,支持跳舞等大型身体动作。
  • 实时视频编辑:支持风格迁移、虚拟试穿,以及根据文本指令进行背景/角色替换,同时保留动作。
  • 空间视频:将流转换为同步的左右眼视图,适用于 VR 头显。
  • 无限长度生成:能够持续实时生成,不会出现稳定性下降。
  • 高效推理:通过 TurboDiffusion 和 TurboServe 针对低成本 GPU 进行优化。

相关

  • 项目
  • 项目