SandAI-org/MAGI-2-preview

MAGI-2-preview: Scaling Video Generation Models Efficiently

解決する課題

MAGI-2 Previewは、ビデオ生成を効率的にスケールさせるために設計されています。テキストまたは画像プロンプトから同期したオーディオを含む高解像度(1080p)ビデオを生成するという課題に対処しつつ、Mixture-of-Experts (MoE) アーキテクチャを使用して、トークンごとにパラメータのわずかな一部のみをアクティブ化することで、巨大なモデル(114Bパラメータ)の実行コストを最適化しています。

仕組み

このモデルは2段階の生成プロセスを使用します。magi2_previewステージで低解像度でクリップのノイズを除去し、magi2_refinerステージでその結果を1080pにアップスケールします。テキストからビデオ(T2V)と画像からビデオ(I2V)の両方のワークフローをサポートしています。出力品質を向上させるために、LLMが短いユーザープロンプトを構造化された詳細なキャプションに書き換えるオプションのプロンプト強化ステップが含まれています。

対象者

このプロジェクトは、統合されたオーディオ付きの高品質な10秒間のビデオクリップを生成したい、ハイエンドなハードウェア(具体的には8枚のNVIDIA Hopper GPU)を保有する研究者や開発者向けです。

ハイライト

  • 統合オーディオ・ビデオ生成: ビデオとサウンドを同時に生成し、それらを単一の出力ファイルにミックスします。
  • 効率的なスケーリング: トークンごとに6Bのパラメータのみをアクティブ化する114Bパラメータモデルを利用しています。
  • 高解像度: 2段階のプレビュー・リファイン・パイプラインを介して1080pビデオを生成可能です。
  • 柔軟な入力: テキストからビデオおよび画像からビデオの両方の生成をサポートしています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト