ModelTC/LightX2V
Lightweight Image Video Action Generation Inference Framework
⚡️ LightX2V – 軽量な動画生成推論フレームワーク
何であるか – LightX2V は、最新の画像・動画生成モデル(テキストから動画、画像から動画、テキストから画像、画像から画像など)を単一GPUまたはマルチGPUクラスタ上で効率的に実行できるオープンソースの推論エンジンです。高速性に特化しており、Diffusers、FastVideo、SGL-Diffusionなどの他のフレームワークと比較して、推論時間を大幅に短縮するための量子化・蒸留されたLoRAチェックポイントと、オフロード、テンソル/シーケンス並列処理、FP8/NVFP4量子化、特徴量キャッシュなどのデプロイテクニックを提供しています。
🎯 コア機能
| 機能 | 詳細 |
|---|---|
| マルチモーダル生成 | テキストから動画(T2V)、画像から動画(I2V)、テキストから画像(T2I)、画像から画像(I2I)、音声同期動画(T2AV、I2AV、FL2AV、Ref2AV)。 |
| 対応モデル | MiniMax-H3、LTX-2/2.3、HunyuanVideo-1.5、Wan 2.1/2.2、SwiftVR、Qwen-Image/-Edit、Self-Forcing、Matrix-Game-2.0 など多数。 |
| 高速化テクニック | 4ステップ蒸留LoRA、CFGフリー推論、FP8/NVFP4量子化、ブロックレベルオフロード、テンソル/シーケンス並列処理、分散デプロイ(Mooncake、T-head PPU、iluvatar、Enflame、MUSA、ROCm、Ascendなど)。 |
| ベンチマーク | H100(8GPU)で40ステップ81フレームの動画を 0.35秒/ステップ(FP8、CFGなし)で実行 – 自身のベースラインより約2倍速く、競合フレームワークと比較して最大 3.9倍 の高速化。 |
| フロントエンド | Gradio Web UI、ComfyUIノードベースUI、Windowsワンクリックインストーラ。 |
| パッケージング | Dockerイメージ、pipインストール可能パッケージ、オプションのカスタムアテンション/量子化カーネル付きソースビルド。 |
🚀 クイックスタート
# リポジトリから直接インストール
pip install -v git+https://github.com/ModelTC/LightX2V.git
またはローカルでクローンしてビルド:
git clone https://github.com/ModelTC/LightX2V.git
cd LightX2V
uv pip install -v . # または: pip install -v .
MiniMax-H3 テキストから音声付き動画の例を実行
from lightx2v import LightX2VPipeline
pipe = LightX2VPipeline(
model_path="/path/to/MiniMax-H3",
model_cls="minimax_h3",
model_variant="fl2av",
)
pipe.create_generator(config_json="configs/minimax_h3/dmd/minimax_h3_bf16_4step.json")
pipe.generate(
task="t2av",
seed=42,
prompt="A cinematic fox walks through a snowy forest while soft wind and distant birds create an immersive winter soundscape.",
save_result_path="outputs/fox.mp4",
)
オプションのアテンション/量子化カーネルの完全インストールや、NVFP4、オフロード、マルチGPUスクリプトなどの詳細例については、examples/ および scripts/ ディレクトリを参照してください。
📚 ドキュメントとコミュニティ
- 英語ドキュメント: https://lightx2v-en.readthedocs.io/en/latest/
- 中国語ドキュメント: https://lightx2v-zhcn.readthedocs.io/zh-cn/latest/
- Dockerイメージ:
lightx2v/lightx2v - HuggingFaceモデルハブ: https://huggingface.co/lightx2v (蒸留LoRA、量子化チェックポイント、オートエンコーダ)
- オンラインデモ: https://x2v.light-ai.top/ (インストール不要の「LightX2V Studio」)
- WeChatグループ: LightX2V Robot – ID
random42seed - 貢献ガイド: PR前に
ruff+pre-commitを実行;READMEに多数のコミュニティ貢献者が記載されています。
🛠️ 一般的な利用ケース
- 動画生成の迅速なプロトタイピング – 開発者はGradio UIやComfyUIノードを使ってT2V/T2AVパイプラインを実験できます。
- プロダクションレベルの推論 – フレームワークの並列処理と量子化により、中程度のGPUファームで高解像度(720-1080p)の動画モデルを提供可能。
- マルチモーダル拡散に関する研究 – LoRAベースのステップ蒸留とカスタムDMD設定の内蔵サポートにより、新しいモデルバリアントのテストが容易。
- エッジ指向のデプロイ – T-head PPU、iluvatar、Enflame、MUSA、ROCm、Ascendなどへの対応により、NVIDIA以外のハードウェアでも推論が可能。
📜 ライセンス
Apache 2.0 – 商用・学術用途で自由に利用可能。
結論 – LightX2Vは、最新世代の画像・動画拡散/フローモデル向けのプロダクション対応で、高度に最適化された推論スタックです。モデルズーブインテグレーション、高速化テクニック、すぐに使えるフロントエンドを統合しており、高速でスケーラブルな動画生成が必要なすべての人にとって堅実な選択肢です。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト