ModelTC/LightX2V
Lightweight Image Video Action Generation Inference Framework
해결하는 문제
LightX2V는 이미지 및 비디오 생성을 더욱 효율적으로 만들기 위해 설계된 고성능 추론 프레임워크입니다. 최첨단 확산(diffusion) 및 자기회귀(autoregressive) 모델의 높은 계산 비용과 메모리 요구 사항을 해결하여, 소비자용 GPU를 포함한 광범위한 하드웨어에서 더 빠른 합성 및 배포를 가능하게 합니다.
작동 원리
이 프레임워크는 다양한 생성 작업(text-to-video, image-to-video, text-to-image, image-editing)을 위한 통합 플랫폼을 제공합니다. 다음과 같은 최적화 기술을 통해 속도 향상을 달성합니다:
- Step Distillation: 추론 단계(예: 50단계에서 4단계로)를 줄여 생성 시간을 획기적으로 단축합니다.
- Quantization: FP8 및 NVFP4 형식을 지원하여 메모리 사용량을 줄이고 처리량을 높입니다.
- Memory Management: 블록 및 단계별 오프로딩을 구현하여 낮은 VRAM을 가진 GPU에서도 대규모 모델을 실행할 수 있도록 합니다.
- Parallelism: CFG 및 Ulysses 병렬 처리를 활용하여 워크로드를 여러 GPU에 분산합니다。
- Hardware Support: NVIDIA (H100, RTX 4090), AMD ROCm, Ascend 910B를 포함한 다양한 가속기에 최적화되어 있습니다.
대상 사용자
- AI 개발자: 여러 비전 생성 모델을 배포하기 위해 통합된 최적화 파이프라인이 필요한 개발자.
- 연구자: 대규모 비디오 모델의 증류 및 양자화 버전을 벤치마킹하거나 배포하려는 연구자.
- 콘텐츠 크리에이터: 고품질 AI 비디오/이미지를 더 적은 하드웨어 오버헤드로 더 빠르게 생성하고자 하는 크리에이터.
주요 특징
- 대규모 속도 향상: 증류 및 시스템 최적화를 통해 단일 GPU에서 최대 20배의 가속을 제공합니다.
- 폭넓은 모델 지원: LTX-2, HunyuanVideo-1.5, Wan2.1/2.2, Qwen-Image와 호환됩니다.
- 유연한 배포: 다양한 사용자 수준을 위해 Gradio, ComfyUI 및 Windows 원클릭 설치 프로그램을 제공합니다。
- 멀티 하드웨어 호환성: NVIDIA, AMD, Intel AIPC 및 다양한 특수 AI 칩을 포함한 광범위한 백엔드를 지원합니다.