ModelTC/LightX2V
Lightweight Image Video Action Generation Inference Framework
⚡️ LightX2V – 가벼운 동영상 생성 추론 프레임워크
무엇인가요 – LightX2V는 단일 GPU 또는 멀티 GPU 클러스터에서 최신 이미지 및 동영상 생성 모델(T2V, I2V, T2I, I2I 등)을 효율적으로 실행할 수 있는 오픈소스 추론 엔진입니다. 속도에 중점을 두며, Diffusers, FastVideo, SGL-Diffusion와 같은 다른 프레임워크에 비해 추론 시간을 크게 단축하는 양자화 및 증류된 LoRA 체크포인트와 함께, 오프로딩, 텐서/시퀀스 병렬 처리, FP8/NVFP4 양자화, 특징 캐싱 등의 배포 기술을 제공합니다.
🎯 핵심 기능
| 기능 | 세부 정보 |
|---|---|
| 다중 모달 생성 | 텍스트에서 동영상(T2V), 이미지에서 동영상(I2V), 텍스트에서 이미지(T2I), 이미지에서 이미지(I2I), 음성 동기화 동영상(T2AV, I2AV, FL2AV, Ref2AV) |
| 지원 모델 | MiniMax-H3, LTX-2/2.3, HunyuanVideo-1.5, Wan 2.1/2.2, SwiftVR, Qwen-Image/-Edit, Self-Forcing, Matrix-Game-2.0 및 기타 많은 모델 |
| 성능 향상 기술 | 4단계 증류된 LoRA, CFG 없는 추론, FP8/NVFP4 양자화, 블록 단위 오프로딩, 텐서/시퀀스 병렬 처리, 분산 배포(Mooncake, T-head PPU, iluvatar, Enflame, MUSA, ROCm, Ascend 등) |
| 벤치마크 | H100(8GPU)에서 40단계 81프레임 동영상을 0.35초/단계(FP8, CFG 없음)로 실행 – 자체 베이스라인보다 약 2배 빠르며, 경쟁 프레임워크 대비 최대 3.9배 빠름 |
| 프론트엔드 | Gradio 웹 UI, ComfyUI 노드 기반 UI, Windows 일클릭 설치 프로그램 |
| 패키징 | Docker 이미지, pip 설치 가능 패키지, 선택적 커스텀 어텐션/양자화 커널을 포함한 소스 빌드 |
🚀 시작하기 (빠른 시작)
# 리포지토리에서 직접 설치
pip install -v git+https://github.com/ModelTC/LightX2V.git
또는 로컬에서 클론하고 빌드:
git clone https://github.com/ModelTC/LightX2V.git
cd LightX2V
uv pip install -v . # 또는: pip install -v .
MiniMax-H3 텍스트에서 음성 동영상 예제 실행
from lightx2v import LightX2VPipeline
pipe = LightX2VPipeline(
model_path="/path/to/MiniMax-H3",
model_cls="minimax_h3",
model_variant="fl2av",
)
pipe.create_generator(config_json="configs/minimax_h3/dmd/minimax_h3_bf16_4step.json")
pipe.generate(
task="t2av",
seed=42,
prompt="A cinematic fox walks through a snowy forest while soft wind and distant birds create an immersive winter soundscape.",
save_result_path="outputs/fox.mp4",
)
옵션 어텐션/양자화 커널의 완전한 설치 및 NVFP4, 오프로딩, 멀티 GPU 스크립트 등의 더 많은 예제는 examples/ 및 scripts/ 디렉터리를 참조하세요.
📚 문서 및 커뮤니티
- 영문 문서: https://lightx2v-en.readthedocs.io/en/latest/
- 중문 문서: https://lightx2v-zhcn.readthedocs.io/zh-cn/latest/
- Docker 이미지:
lightx2v/lightx2v - HuggingFace 모델 허브: https://huggingface.co/lightx2v (증류된 LoRA, 양자화 체크포인트, 오토인코더)
- 온라인 데모: https://x2v.light-ai.top/ (설치 없이 사용 가능한 "LightX2V Studio")
- 웨이챗 그룹: LightX2V Robot – ID
random42seed - 기여 가이드: PR 전에
ruff+pre-commit실행; README에 많은 커뮤니티 기여자가 명시되어 있음.
🛠️ 일반적인 사용 사례
- 동영상 생성의 빠른 프로토타이핑 – 개발자는 Gradio UI 또는 ComfyUI 노드를 사용해 T2V/T2AV 파이프라인을 실험할 수 있음.
- 생산 수준 추론 – 프레임워크의 병렬 처리 및 양자화 기능으로 중간 규모 GPU 팜에서 고해상도(720-1080p) 동영상 모델을 제공 가능.
- 다중 모달 확산 연구 – LoRA 기반 단계 증류 및 사용자 정의 DMD 설정 지원으로 새로운 모델 버전 테스트가 쉬움.
- 에지 기반 배포 – T-head PPU, iluvatar, Enflame, MUSA, ROCm, Ascend 등에 대한 지원으로 NVIDIA 외 하드웨어에서도 추론 가능.
📜 라이선스
Apache 2.0 – 상업 및 학술 목적 모두 무료 사용 가능.
결론 – LightX2V는 최신 세대의 이미지 및 동영상 확산/플로우 모델을 위한 프로덕션 준비 완료된 고도로 최적화된 추론 스택입니다. 모델 자료실 통합, 성능 향상 기술, 바로 사용 가능한 프론트엔드를 통합하여, 빠르고 확장 가능한 동영상 생성이 필요한 모든 사람에게 안정적인 선택입니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트