ModelTC/LightX2V

Lightweight Image Video Action Generation Inference Framework

解决的问题

LightX2V 是一个高性能推理框架,旨在提高图像和视频生成的效率。它解决了最先进的扩散模型和自回归模型的高计算成本和高内存需求问题,使得在包括消费级 GPU 在内的更广泛硬件上实现更快的合成和部署成为可能。

工作原理

该框架为各种生成任务(text-to-video、image-to-video、text-to-image 和 image-editing)提供了一个统一的平台。它通过以下几种优化技术实现加速:

  • Step Distillation: 减少推理步骤(例如从 50 步减少到 4 步),从而大幅缩短生成时间。
  • Quantization: 支持 FP8 和 NVFP4 格式,以减少内存占用并提高吞吐量。
  • Memory Management: 实现块级和阶段级卸载,允许在显存较低的 GPU 上运行大型模型。
  • Parallelism: 利用 CFG 和 Ulysses 并行技术将工作负载分配到多个 GPU 上。
  • Hardware Support: 针对各种加速器进行了优化,包括 NVIDIA (H100, RTX 4090)、AMD ROCm、Ascend 910B 等。

适用对象

  • AI 开发者: 需要用于部署多种视觉生成模型的统一、优化流水线的开发者。
  • 研究人员: 寻求对大型视频模型的蒸馏和量化版本进行基准测试或部署的研究人员。
  • 内容创作者: 希望以更少的硬件开销更快地生成高质量 AI 视频/图像的创作者。

亮点

  • 大幅加速: 通过蒸馏和系统优化,声称在单 GPU 上可实现高达 20 倍的加速。
  • 广泛的模型支持: 兼容 LTX-2、HunyuanVideo-1.5、Wan2.1/2.2 和 Qwen-Image。
  • 灵活的部署: 为不同层级的用户提供 Gradio、ComfyUI 和 Windows 一键安装程序。
  • 多硬件兼容性: 支持包括 NVIDIA、AMD、Intel AIPC 和各种专用 AI 芯片在内的广泛后端。