shengshu-ai/Vidu-S

Vidu S: Real-Time Interactive, Editable, and Spatial Video Generation

解決的問題

Vidu S 是一套即時互動影片生成模型,旨在克服高解析度影片串流相關的延遲與穩定性問題。它能夠建立高傳真數位角色、即時影片編輯,以及可即時回應使用者指令的沉浸式空間影片。

運作方式

此專案包含兩個主要版本:

  • Vidu S1:用於語音控制數位角色的模型,以最高 42 FPS 產生 540p 影片,支援自訂角色與語調。
  • Vidu S2:進階版本,將功能擴展至 720p 互動式虛擬人(25–42 FPS),並可即時編輯輸入的影片串流。

Vidu S2 採用稱為 Self-Replay Forcing (SRF) 的技術,防止跨串流區段的錯誤累積,確保長期穩定性。在效能方面,它使用最佳化的服務堆疊(TurboDiffusion 與 TurboServe),具備低位元 GEMM 與多 GPU 管線化,可在低成本 GPU 上執行。

適用對象

需要即時、互動式影片生成技術的開發者與創作者,應用於數位虛擬人、VR/AR 沉浸式顯示,以及即時影片風格轉換或角色替換。

重點特色

  • 即時互動虛擬人:以 25-42 FPS 產生 720p 影片,支援跳舞等大型肢體動作。
  • 即時影片編輯:支援風格轉換、虛擬試穿,以及根據文字指令進行背景/角色替換,同時保留動作。
  • 空間影片:將串流轉換為同步的左右眼視圖,適用於 VR 頭戴裝置。
  • 無限長度生成:能夠持續即時生成,不會有穩定性衰退。
  • 高效推論:透過 TurboDiffusion 與 TurboServe 最佳化,適用於低成本 GPU。

相關

  • 專案
  • 專案