aigc-apps/VideoX-Fun
📹 A more flexible framework that can generate videos at any resolution and creates videos from images.
何を解決するか
VideoX-Fun は高品質な AI 動画と画像を生成する包括的なパイプラインを提供します。制御された動画生成の課題に対処し、ユーザーが開始フレームと終了フレームを指定したり、スタイル転送に参照動画を使用したり、Cannyエッジ、深度マップ、人間のポーズなどの正確な構造制御を適用して生成コンテンツの動きや構成をガイドできるようにします。
仕組み
このプロジェクトは、Diffusion Transformer (DiT) アーキテクチャを採用しており、特に CogVideoX-Fun および Wan 2.1 シリーズモデルをサポートしています。以下の複数の生成モードを提供します:
- テキストから動画 (T2V): テキストプロンプトから動画を生成します。
- 画像から動画 (I2V): 1つまたは2つの画像(開始フレームと終了フレーム)を使用してシーンをアニメーション化します。
- 動画から動画 (V2V): 参照動画を使用して新しい動画の生成をガイドします。
- 制御付き生成: Canny、ポーズ、深度、MLSD などの特定条件を強制する制御モデルを活用し、カメラの動き制御(上下左右パン)も可能にします。
消費向け GPU でのパフォーマンス最適化のために、CPUオフロードやfloat8量子化などのメモリ管理戦略を実装しています。
対象ユーザー
このツールは、動きやスタイルに対して高い制御性を持つ映画的な AI 動画を生成したい AI アーティスト、コンテンツクリエイター、開発者向けに設計されています。また、特定のスタイル変換用のベースラインまたは Lora モデルを独自にトレーニングしたい研究者にも適しています。
特徴
- マルチモデル対応: CogVideoX-Fun および Wan 2.1 シリーズ(1.3B および 14B モデル)の統合サポート。
- 正確な制御: カメラ軌道制御および構造ガイド(Canny、深度、ポーズ)に対応。
- カスタムトレーニング: ベースラインおよび Lora モデルのトレーニングが可能。人間の好み最適化のための Reward Lora サポートも搭載。
- 柔軟なデプロイ: ComfyUI、Docker、または直接 Python スクリプトから利用可能。Windows および Linux 両方に対応。
関連
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト