ModelTC/LightX2V

Lightweight Image Video Action Generation Inference Framework

⚡️ LightX2V – 轻量级视频生成推理框架

是什么 – LightX2V 是一个开源推理引擎,可在单个 GPU 或多 GPU 集群上高效运行最先进的图像与视频生成模型(文本到视频、图像到视频、文本到图像、图像到图像等)。它专注于速度:作者提供了量化、蒸馏的 LoRA 检查点以及一系列部署技巧(卸载、张量/序列并行、FP8/NVFP4 量化、特征缓存),与 Diffusers、FastVideo 或 SGL-Diffusion 等其他框架相比,显著缩短了推理时间。


🎯 核心功能

功能 详情
多模态生成 文本到视频(T2V)、图像到视频(I2V)、文本到图像(T2I)、图像到图像(I2I)以及音视频同步视频(T2AV、I2AV、FL2AV、Ref2AV)。
支持模型 MiniMax-H3、LTX-2/2.3、HunyuanVideo-1.5、Wan 2.1/2.2、SwiftVR、Qwen-Image/-Edit、Self-Forcing、Matrix-Game-2.0 等。
加速技巧 4步蒸馏 LoRA、CFG 无推理、FP8/NVFP4 量化、块级卸载、张量/序列并行、解耦部署(Mooncake、T-head PPU、iluvatar、Enflame、MUSA、ROCm、Ascend 等)。
基准测试 在 H100(8 GPU)上,LightX2V 以 0.35 秒/步(FP8,无 CFG)完成 40 步 81 帧视频生成——比自身基线快约 2 倍,比竞争框架最快快 3.9 倍
前端 Gradio Web UI、ComfyUI 节点式 UI、Windows 一键安装程序。
打包方式 Docker 镜像、pip 可安装包、支持可选自定义注意力/量化内核的源码构建。

🚀 快速上手(快速启动)

# 直接从仓库安装
pip install -v git+https://github.com/ModelTC/LightX2V.git

或克隆并本地构建:

git clone https://github.com/ModelTC/LightX2V.git
cd LightX2V
uv pip install -v .   # 或:pip install -v .

运行 MiniMax-H3 文本到音视频示例

from lightx2v import LightX2VPipeline
pipe = LightX2VPipeline(
    model_path="/path/to/MiniMax-H3",
    model_cls="minimax_h3",
    model_variant="fl2av",
)
pipe.create_generator(config_json="configs/minimax_h3/dmd/minimax_h3_bf16_4step.json")
pipe.generate(
    task="t2av",
    seed=42,
    prompt="A cinematic fox walks through a snowy forest while soft wind and distant birds create an immersive winter soundscape.",
    save_result_path="outputs/fox.mp4",
)

如需完整安装可选注意力/量化内核,以及更多示例(NVFP4、卸载、多 GPU 脚本),请参阅 examples/scripts/ 目录。


📚 文档与社区


🛠️ 典型应用场景

  • 视频生成的快速原型开发 – 开发者可快速搭建 Gradio UI 或 ComfyUI 节点,实验 T2V/T2AV 流水线。
  • 生产级推理 – 框架的并行化与量化能力,使在中等规模 GPU 集群上部署高分辨率(720-1080p)视频模型成为可能。
  • 多模态扩散研究 – 内置 LoRA 基础的步长蒸馏与自定义 DMD 配置,便于测试新型模型变体。
  • 边缘部署 – 支持 T-head PPU、iluvatar、Enflame、MUSA、ROCm、Ascend 等,可在非 NVIDIA 硬件上运行。

📜 许可证

Apache 2.0 – 免费用于商业与学术用途。


总结 – LightX2V 是面向新一代图像与视频扩散/流模型的生产就绪、高度优化的推理栈。它集成了模型库、加速技巧与开箱即用的前端,是任何需要快速、可扩展视频生成的用户的坚实选择。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目