ModelTC/LightX2V

Lightweight Image Video Action Generation Inference Framework

⚡️ LightX2V – 軽量な動画生成推論フレームワーク

何であるか – LightX2V は、最新の画像・動画生成モデル(テキストから動画、画像から動画、テキストから画像、画像から画像など)を単一GPUまたはマルチGPUクラスタ上で効率的に実行できるオープンソースの推論エンジンです。高速性に特化しており、Diffusers、FastVideo、SGL-Diffusionなどの他のフレームワークと比較して、推論時間を大幅に短縮するための量子化・蒸留されたLoRAチェックポイントと、オフロード、テンソル/シーケンス並列処理、FP8/NVFP4量子化、特徴量キャッシュなどのデプロイテクニックを提供しています。


🎯 コア機能

機能 詳細
マルチモーダル生成 テキストから動画(T2V)、画像から動画(I2V)、テキストから画像(T2I)、画像から画像(I2I)、音声同期動画(T2AV、I2AV、FL2AV、Ref2AV)。
対応モデル MiniMax-H3、LTX-2/2.3、HunyuanVideo-1.5、Wan 2.1/2.2、SwiftVR、Qwen-Image/-Edit、Self-Forcing、Matrix-Game-2.0 など多数。
高速化テクニック 4ステップ蒸留LoRA、CFGフリー推論、FP8/NVFP4量子化、ブロックレベルオフロード、テンソル/シーケンス並列処理、分散デプロイ(Mooncake、T-head PPU、iluvatar、Enflame、MUSA、ROCm、Ascendなど)。
ベンチマーク H100(8GPU)で40ステップ81フレームの動画を 0.35秒/ステップ(FP8、CFGなし)で実行 – 自身のベースラインより約2倍速く、競合フレームワークと比較して最大 3.9倍 の高速化。
フロントエンド Gradio Web UI、ComfyUIノードベースUI、Windowsワンクリックインストーラ。
パッケージング Dockerイメージ、pipインストール可能パッケージ、オプションのカスタムアテンション/量子化カーネル付きソースビルド。

🚀 クイックスタート

# リポジトリから直接インストール
pip install -v git+https://github.com/ModelTC/LightX2V.git

またはローカルでクローンしてビルド:

git clone https://github.com/ModelTC/LightX2V.git
cd LightX2V
uv pip install -v .   # または: pip install -v .

MiniMax-H3 テキストから音声付き動画の例を実行

from lightx2v import LightX2VPipeline
pipe = LightX2VPipeline(
    model_path="/path/to/MiniMax-H3",
    model_cls="minimax_h3",
    model_variant="fl2av",
)
pipe.create_generator(config_json="configs/minimax_h3/dmd/minimax_h3_bf16_4step.json")
pipe.generate(
    task="t2av",
    seed=42,
    prompt="A cinematic fox walks through a snowy forest while soft wind and distant birds create an immersive winter soundscape.",
    save_result_path="outputs/fox.mp4",
)

オプションのアテンション/量子化カーネルの完全インストールや、NVFP4、オフロード、マルチGPUスクリプトなどの詳細例については、examples/ および scripts/ ディレクトリを参照してください。


📚 ドキュメントとコミュニティ


🛠️ 一般的な利用ケース

  • 動画生成の迅速なプロトタイピング – 開発者はGradio UIやComfyUIノードを使ってT2V/T2AVパイプラインを実験できます。
  • プロダクションレベルの推論 – フレームワークの並列処理と量子化により、中程度のGPUファームで高解像度(720-1080p)の動画モデルを提供可能。
  • マルチモーダル拡散に関する研究 – LoRAベースのステップ蒸留とカスタムDMD設定の内蔵サポートにより、新しいモデルバリアントのテストが容易。
  • エッジ指向のデプロイ – T-head PPU、iluvatar、Enflame、MUSA、ROCm、Ascendなどへの対応により、NVIDIA以外のハードウェアでも推論が可能。

📜 ライセンス

Apache 2.0 – 商用・学術用途で自由に利用可能。


結論 – LightX2Vは、最新世代の画像・動画拡散/フローモデル向けのプロダクション対応で、高度に最適化された推論スタックです。モデルズーブインテグレーション、高速化テクニック、すぐに使えるフロントエンドを統合しており、高速でスケーラブルな動画生成が必要なすべての人にとって堅実な選択肢です。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト