Lightricks/LTX-2

Official Python inference and LoRA trainer package for the LTX-2 audio–video generative model.

What it solves

LTX-2 是一个基础模型,旨在将现代视频生成的核心能力统一于单一系统。它解决了制作高保真、可直接投入生产的影片,同时具备同步音频与视频的挑战,并提供灵活的性能模式以满足不同的速度和质量需求。

How it works

基于 Diffusion Transformer(DiT)架构,LTX-2 使用多阶段管线方法生成内容。它支持多种生成模式,包括文本到视频、图像到视频和音频到视频。系统使用文本编码器(Gemma 3),并提供多条专门管线——例如用于快速推理的蒸馏管线,以及通过空间上采样提升分辨率的双阶段管线。它还支持 LoRA 以细粒度控制摄像机运动、姿态和细节,并支持 IC‑LoRA 用于唇形配音和 HDR 输出等任务。

Who it’s for

该项目面向需要生产级视频生成的创作者和开发者,从需要快速原型(通过单阶段或蒸馏管线)的用户,到需要高保真输出且对摄像机角度和角色动作有精确电影级控制的用户皆适用。

Highlights

  • Unified Capabilities: 将同步音频和视频生成合并于同一模型。
  • Diverse Pipelines: 提供文本/图像到视频、音频到视频、关键帧插值和视频到视频等专门工作流。
  • Advanced Control: 包含针对特定摄像机运动(推车、吊臂)的 LoRA,以及用于唇形配音和 HDR 的 IC‑LoRA。
  • Optimization Options: 支持 FP8 量化和 FlashAttention 3/4,降低内存占用并提升兼容 GPU 的速度。
  • Training Tools: 包含 LoRA 与完整微调的专用训练包。