Lightricks/LTX-2

Official Python inference and LoRA trainer package for the LTX-2 audio–video generative model.

What it solves

LTX-2 是一個基礎模型,旨在將現代影片生成的核心能力統一於單一系統。它解決了製作高保真、可直接投入製作的影片,同時具備同步音訊與影像的挑戰,並提供彈性的效能模式以因應不同的速度與品質需求。

How it works

基於 Diffusion Transformer(DiT)架構,LTX-2 採用多階段管線方式產生內容。它支援多種生成模式,包括文字轉影片、圖像轉影片與音訊轉影片。系統使用文字編碼器(Gemma 3),並提供多條專門管線——例如用於快速推論的蒸餾管線,以及透過空間升頻提升解析度的雙階段管線。它亦支援 LoRA 以細緻控制鏡頭移動、姿勢與細節,並支援 IC‑LoRA 用於唇形配音與 HDR 輸出等任務。

Who it’s for

此專案面向需要製作級影片生成的創作者與開發者,從需要快速原型(透過單階段或蒸餾管線)的使用者,到需要高保真輸出且對鏡頭角度與角色動作有精確電影級控制的使用者皆適用。

Highlights

  • Unified Capabilities: 結合同步音訊與影片生成於同一模型。
  • Diverse Pipelines: 提供文字/圖像轉影片、音訊轉影片、關鍵幀插值與影片轉影片等專門工作流程。
  • Advanced Control: 包含針對特定鏡頭移動(推車、吊臂)的 LoRA,以及用於唇形配音與 HDR 的 IC‑LoRA。
  • Optimization Options: 支援 FP8 量化與 FlashAttention 3/4,降低記憶體占用並提升相容 GPU 的速度。
  • Training Tools: 包含 LoRA 與完整微調的專屬訓練套件。