Lightricks/LTX-2
Official Python inference and LoRA trainer package for the LTX-2 audio–video generative model.
What it solves
LTX-2 は、最新の動画生成のコア機能を単一システムに統合することを目的とした基礎モデルです。高忠実度でプロダクションレベルの動画を、音声と映像が同期した状態で作成する課題に取り組み、速度と品質のニーズに応じた柔軟なパフォーマンスモードを提供します。
How it works
Diffusion Transformer(DiT)アーキテクチャ上に構築され、LTX-2 はマルチステージパイプライン方式でコンテンツを生成します。テキスト→動画、画像→動画、音声→動画など様々な生成モードをサポートします。システムはテキストエンコーダ(Gemma 3)を使用し、高速推論用の蒸留パイプラインや、空間アップスケーリングによる高解像度化を実現する二段階パイプラインなど、複数の専門パイプラインを提供します。また、カメラの動き、ポーズ、ディテールを細かく制御する LoRA、リップダビングや HDR 出力などのタスク向け IC‑LoRA もサポートしています。
Who it’s for
本プロジェクトは、制作品質の動画生成を必要とするクリエイターや開発者を対象としています。単段階または蒸留パイプラインでの高速プロトタイピングが必要な方から、カメラアングルやキャラクター動作を精密にコントロールした高忠実度出力を求める方まで、幅広く活用できます。
Highlights
- Unified Capabilities: 同期音声と動画生成を一つのモデルで実現。
- Diverse Pipelines: テキスト/画像→動画、音声→動画、キーフレーム補間、動画→動画変換などの専門ワークフローを提供。
- Advanced Control: カメラの特定動作(ドリー、ジブ)用 LoRA と、リップダビングや HDR 用 IC‑LoRA を含む。
- Optimization Options: FP8 量子化と FlashAttention 3/4 をサポートし、メモリフットプリントを削減し、対応 GPU 上で速度を向上。
- Training Tools: LoRA とフルファインチューニング用の専用トレーナーパッケージを含む。