OpenMOSS/MOVA

A foundation model that generates synchronized video and audio in a single model

MOVA とは何か?

MOVA(MOSS Video Audio)は、同期された動画と音声を1回のフォワードパスで生成するオープンソースのファウンデーションモデルです。テキストプロンプト(オプションで参照画像を含む)を受け取り、発話内容と口の動きが一致し、背景音がシーンに適した短い動画を出力できます。


コアとなるアイデア

機能 なぜ重要か
ネイティブなバイモーダル生成 別々のテキスト→動画 + テキスト→音声パイプラインが不要。両モダリティを同時に生成することで、誤差の蓄積を回避。
非対称なデュアルタワーアーキテクチャ 事前学習済みの動画エンコーダーと音声エンコーダーが、双方向クロスアテンションで相互に通信。豊かなマルチモーダル相互作用を実現。
リップシンク & サウンドエフェクト Verse-Benchベンチマークで示される最先端の多言語リップシンクと環境に適応した音声生成。
完全なオープンソース モデル重み、推論コード、学習パイプライン、LoRA微調整スクリプト、評価スイート、パブリックAPIすべてを公開。
ハードウェアの柔軟性 GPU、NVIDIA H100/RTX 4090、Ascend NPU、VRAM制限環境向けのオフロード戦略をサポート。

クイックスタート(導入)

  1. 環境の作成
    conda create -n mova python=3.13 -y
    conda activate mova
    pip install -e .
    
  2. チェックポイントのダウンロード(例:360p)Hugging Faceから:
    hf download OpenMOSS-Team/MOVA-360p --local-dir /path/to/MOVA-360p
    
  3. 推論の実行 – 単一人物の例:
    export CP_SIZE=1
    export CKPT_PATH=/path/to/MOVA-360p
    torchrun --nproc_per_node=$CP_SIZE \
        scripts/inference_single.py \
        --ckpt_path $CKPT_PATH \
        --cp_size $CP_SIZE \
        --height 352 --width 640 \
        --prompt "A man in a blue blazer …" \
        --ref_path ./assets/single_person.jpg \
        --output_path ./data/samples/single_person.mp4 \
        --seed 42 \
        --offload cpu
    
    複数人物のシーンには、プロンプトと --ref_path を変更してください。

微調整方法(LoRA)

  • configs/training/ 内の設定ファイルから選択(低リソース、accelerate、8GPU向け accelerate + FSDP)。
  • 学習用追加パッケージのインストール: pip install -e ".[train]"torchcodec, bitsandbytes を追加)。
  • 提供されたシェルスクリプトで起動、例:
    bash scripts/training_scripts/example/low_resource_train.sh
    
  • すべてのLoRAハイパーパラメータ(ランク、ターゲットモジュール、オプティマイザ、オフロード戦略)は設定ファイルに記載。

評価

  • リポジトリには evaluation/ フォルダがあり、11のメトリクス(音声品質、リップシンク、AV同期など)をカバー。
  • 再現性のため、Verse-Bench と人間評価の Arena ベンチマーク(732サンプル)の事前計算結果を提供。

エコシステム連携

連携 何が得られるか
SGLang sglang generatesglang serve による即時高スループット推論。
ComfyUI コミュニティノード comfyui-mova で視覚プログラミングパイプライン(I2VA および T2VA 対応)。
API studio.mosi.cn でホストされたサービス。ローカルハードウェアなしで動画生成のためのキー申請可能。
Streamlitワークフロー エンドツーエンドUI。最初のフレームを自動生成、プロンプトの再書き換え、MOVA呼び出しを可能に。

リソース

  • モデル重み – Hugging Faceコレクション: MOVA-360p, MOVA-720p
  • 技術レポート – arXiv: 2602.08794(2026年2月)。
  • デモ動画 – READMEまたはウェブサイト https://mosi.cn/models/mova を参照。
  • コミュニティ – バッジバーにリンクされたDiscord、X(Twitter)、Feishuグループ。
  • 引用 – 学術利用用にREADMEに提供。

TL;DR

MOVAは、テキスト(およびオプションの画像)から短いリップシンク動画を生成できる、公開されたデュアルタワー型ビデオ・オーディオ拡散モデルです。単一GPUで推論を実行、LoRAによる微調整、結果の評価、SGLang、ComfyUI、ホストAPIなど人気ツールへの統合に必要なすべてがリポジトリに含まれています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト