OpenMOSS/MOVA

MOVA: Towards Scalable and Synchronized Video–Audio Generation

What it solves

MOVA は、同時に高忠実度のビデオと同期オーディオを生成することを目的とした基盤モデルです。音声を別個に、しばしば同期が取れないステップとして追加するカスケードパイプラインが不要となり、オープンソースのビデオ生成における口パクのずれや音響効果の非同期といった問題を解決します。

How it works

MOVA は非対称のデュアルタワーアーキテクチャを採用し、事前学習済みのビデオタワーとオーディオタワーを組み合わせます。これらのタワーは双方向クロスアテンション機構で融合され、単一の推論パスで両モダリティを合成できるようになります。Text-to-Video-Audio (T2VA) と Image-to-Video-Audio (I2VA) の両ワークフローをサポートします。

Who it’s for

このプロジェクトは、高品質で同期された視覚・聴覚コンテンツを必要とする AI 研究者、開発者、コンテンツクリエイター向けです。特に多言語のリップシンクや環境認識音響効果を実装したい方に有用です。

Highlights

  • Native Bimodal Generation: 1 回の推論でビデオとオーディオを同時生成し、エラー蓄積を防ぎ完璧なアラインメントを実現。
  • Precise Lip-Sync: 多言語リップシンクで最先端の性能を達成。
  • Open-Source Ecosystem: モデルウェイト、推論コード、トレーニングパイプライン、LoRA ファインチューニングスクリプトを提供。
  • Broad Integration: 高スループット推論のための SGLang、コミュニティプラグインによる ComfyUI への統合、ホスト型 API をサポート。
  • Flexible Hardware Support: VRAM オフロード最適化と Ascend NPU のサポートを含む。