shengshu-ai/Vidu-S

Vidu S: Real-Time Interactive, Editable, and Spatial Video Generation

解決する課題

Vidu S は、高解像度ビデオストリーミングに伴う遅延と安定性の問題を克服するために設計された、リアルタイム対話型ビデオ生成モデルのスイートです。高忠実度のデジタルキャラクター、ライブビデオ編集、そしてユーザーの指示にリアルタイムで応答できる没入型空間ビデオの作成を可能にします。

仕組み

このプロジェクトは、主に2つのバージョンで構成されています:

  • Vidu S1: 音声制御のデジタルキャラクター向けモデルで、最大42 FPSで540pビデオを生成し、カスタムキャラクターと音声トーンをサポートします。
  • Vidu S2: 720pのインタラクティブアバター(25~42 FPS)と、入力ビデオストリームのリアルタイム編集に機能を拡張した高度なバージョンです。

Vidu S2 は、Self-Replay Forcing (SRF) と呼ばれる技術を採用し、ストリーミングセグメント間のエラー蓄積を防ぎ、長期的な安定性を確保します。パフォーマンスについては、低ビットGEMMとマルチGPUパイプラインを備えた最適化されたサービングスタック(TurboDiffusion と TurboServe)を使用し、低コストGPUで実行できます。

対象者

デジタルアバター、VR/AR没入型ディスプレイ、ライブビデオのスタイル転送やキャラクター置換のためのリアルタイムでインタラクティブなビデオ生成を必要とする開発者とクリエイター。

ハイライト

  • リアルタイムインタラクティブアバター: ダンスなどの大きな体の動きをサポートし、25〜42 FPSで720pビデオを生成。
  • ライブビデオ編集: スタイル転送、バーチャル試着、テキスト指示による背景/キャラクター置換を、モーションを維持しながらサポート。
  • 空間ビデオ: ストリームをVRヘッドセット用の同期された左右の視点に変換。
  • 無限長生成: 安定性を損なうことなく、継続的なリアルタイム生成が可能。
  • 効率的な推論: TurboDiffusion と TurboServe により低コストGPU向けに最適化。

関連

  • プロジェクト
  • プロジェクト