Wan-Video/Wan2.2
Wan: Open and Advanced Large-Scale Video Generative Models
何を解決するか
Wan2.2 は、テキスト、画像、または音声から高品質な映画レベルの動画を生成するための大規模な動画生成モデルのセットです。複雑な動き、正確な美学的コントロール、高解像度(最大720P)を維持しながら、計算効率も確保するという課題に対処しています。
仕組み
このプロジェクトは、動画拡散モデルにMixture-of-Experts(MoE)アーキテクチャを採用しています。これにより、ノイズ除去の各ステップに特化したエキスパートモデルを使用することで、計算コストを増加させることなくモデル容量を拡大できます。また、照明や構図のコントロールを向上させるために、精査された美学データを含む大規模な画像・動画データセットで訓練されています。高効率な生成のため、16x16x4の圧縮比を持つ専用VAEを使用しています。
対象ユーザー
AI動画生成分野の研究者や開発者、および高精細で映画的な動画合成ツールを必要とする産業界のクリエイター向けです。高級GPUだけでなく、RTX 4090のような一般消費者向けハードウェアでも動作可能です。
特徴
- マルチモーダル入力: テキストから動画(T2V)、画像から動画(I2V)、テキスト・画像から動画(TI2V)、音声から動画(S2V)の生成をサポート。
- 映画的コントロール: 照明、色調、構図に関する詳細なラベルにより、美学的なカスタマイズを正確に実現。
- 効率的な高解像度生成: 5Bモデルにより、一般消費者向けグラフィックカードで720P@24fpsの生成が可能。
- 高度なアニメーション: キャラクターのアニメーションや置き換えに特化したモデルを搭載し、全体的な動きの再現を実現。
- スケーラブルな推論: PyTorch FSDP および DeepSpeed Ulysses を使用して、単一GPUおよびマルチGPU推論をサポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト