Lightricks/LTX-2

Official Python inference and LoRA trainer package for the LTX-2 audio–video generative model.

What it solves

LTX-2는 최신 비디오 생성의 핵심 기능을 하나의 시스템으로 통합하도록 설계된 기반 모델입니다. 고품질·프로덕션 수준의 비디오를 오디오와 동기화된 상태로 만드는 문제를 해결하고, 속도와 품질 요구에 맞춘 유연한 성능 모드를 제공합니다.

How it works

Diffusion Transformer(DiT) 아키텍처 위에 구축된 LTX-2는 다단계 파이프라인 방식을 사용해 콘텐츠를 생성합니다. 텍스트‑투‑비디오, 이미지‑투‑비디오, 오디오‑투‑비디오 등 다양한 생성 모드를 지원합니다. 시스템은 텍스트 인코더(Gemma 3)를 활용하며, 빠른 추론을 위한 디스틸 파이프라인과 공간 업스케일링을 통한 고해상도를 위한 2단계 파이프라인 등 여러 특화 파이프라인을 제공합니다. 또한 카메라 움직임, 포즈, 디테일을 세밀하게 제어하는 LoRA와 립 더빙·HDR 출력과 같은 작업을 위한 IC‑LoRA도 지원합니다.

Who it’s for

이 프로젝트는 프로덕션 품질의 비디오 생성을 필요로 하는 크리에이터와 개발자를 대상으로 합니다. 단일 단계 또는 디스틸 파이프라인을 통한 빠른 프로토타이핑이 필요한 사용자부터, 카메라 앵글과 캐릭터 움직임을 정밀하게 제어하는 고품질 출력을 원하는 사용자까지 모두 활용할 수 있습니다.

Highlights

  • Unified Capabilities: 동기화된 오디오와 비디오 생성을 하나의 모델에 통합.
  • Diverse Pipelines: 텍스트/이미지‑투‑비디오, 오디오‑투‑비디오, 키프레임 보간, 비디오‑투‑비디오 변환 등 특화 워크플로 제공.
  • Advanced Control: 특정 카메라 움직임(돌리, 지브)용 LoRA와 립 더빙·HDR용 IC‑LoRA 포함.
  • Optimization Options: FP8 양자화와 FlashAttention 3/4를 지원해 메모리 사용량을 줄이고 호환 GPU에서 속도를 높임.
  • Training Tools: LoRA와 전체 파인튜닝을 위한 전용 트레이너 패키지 포함.