ModelTC/LightX2V

Lightweight Image Video Action Generation Inference Framework

解決する課題

LightX2Vは、画像および動画生成をより効率的に行うために設計された高性能推論フレームワークです。最先端の拡散モデルや自己回帰モデルにおける高い計算コストとメモリ要件に対処し、コンシューマー向けGPUを含む幅広いハードウェアでの高速な合成とデプロイを可能にします。

仕組み

このフレームワークは、さまざまな生成タスク(text-to-video、image-to-video、text-to-image、image-editing)のための統合プラットフォームを提供します。以下の最適化技術を通じて高速化を実現します:

  • Step Distillation: 推論ステップ数(例:50から4へ)を削減し、生成時間を劇的に短縮します。
  • Quantization: FP8およびNVFP4フォーマットをサポートし、メモリフットプリントを削減してスループットを向上させます。
  • Memory Management: ブロックレベルおよびフェーズレベルのオフロードを実装し、低VRAMのGPUでも大規模モデルを実行できるようにします。
  • Parallelism: CFGおよびUlysses並列処理を利用して、ワークロードを複数のGPUに分散させます。
  • Hardware Support: NVIDIA (H100, RTX 4090)、AMD ROCm、Ascend 910Bなど、さまざまなアクセラレータ向けに最適化されています。

対象ユーザー

  • AI開発者: 複数のビジョン生成モデルをデプロイするために、統合された最適化パイプラインを必要とする方。
  • 研究者: 大規模動画モデルの蒸留・量子化バージョンのベンチマークやデプロイを検討している方。
  • コンテンツクリエイター: 高品質なAI動画・画像を、より少ないハードウェア負荷で、より速く生成したい方。

ハイライト

  • 大幅な高速化: 蒸留とシステム最適化により、シングルGPUで最大20倍の加速を実現。
  • 幅広いモデルサポート: LTX-2、HunyuanVideo-1.5、Wan2.1/2.2、Qwen-Imageに対応。
  • 柔軟なデプロイ: さまざまなユーザーレベル向けに、Gradio、ComfyUI、Windows用ワンクリックインストーラーを提供。
  • マルチハードウェア互換性: NVIDIA、AMD、Intel AIPC、および各種専用AIチップを含む幅広いバックエンドをサポート。