ModelTC/LightX2V
Lightweight Image Video Action Generation Inference Framework
⚡️ LightX2V – 轻量级视频生成推理框架
是什么 – LightX2V 是一个开源推理引擎,可在单个 GPU 或多 GPU 集群上高效运行最先进的图像与视频生成模型(文本到视频、图像到视频、文本到图像、图像到图像等)。它专注于速度:作者提供了量化、蒸馏的 LoRA 检查点以及一系列部署技巧(卸载、张量/序列并行、FP8/NVFP4 量化、特征缓存),与 Diffusers、FastVideo 或 SGL-Diffusion 等其他框架相比,显著缩短了推理时间。
🎯 核心功能
| 功能 | 详情 |
|---|---|
| 多模态生成 | 文本到视频(T2V)、图像到视频(I2V)、文本到图像(T2I)、图像到图像(I2I)以及音视频同步视频(T2AV、I2AV、FL2AV、Ref2AV)。 |
| 支持模型 | MiniMax-H3、LTX-2/2.3、HunyuanVideo-1.5、Wan 2.1/2.2、SwiftVR、Qwen-Image/-Edit、Self-Forcing、Matrix-Game-2.0 等。 |
| 加速技巧 | 4步蒸馏 LoRA、CFG 无推理、FP8/NVFP4 量化、块级卸载、张量/序列并行、解耦部署(Mooncake、T-head PPU、iluvatar、Enflame、MUSA、ROCm、Ascend 等)。 |
| 基准测试 | 在 H100(8 GPU)上,LightX2V 以 0.35 秒/步(FP8,无 CFG)完成 40 步 81 帧视频生成——比自身基线快约 2 倍,比竞争框架最快快 3.9 倍。 |
| 前端 | Gradio Web UI、ComfyUI 节点式 UI、Windows 一键安装程序。 |
| 打包方式 | Docker 镜像、pip 可安装包、支持可选自定义注意力/量化内核的源码构建。 |
🚀 快速上手(快速启动)
# 直接从仓库安装
pip install -v git+https://github.com/ModelTC/LightX2V.git
或克隆并本地构建:
git clone https://github.com/ModelTC/LightX2V.git
cd LightX2V
uv pip install -v . # 或:pip install -v .
运行 MiniMax-H3 文本到音视频示例
from lightx2v import LightX2VPipeline
pipe = LightX2VPipeline(
model_path="/path/to/MiniMax-H3",
model_cls="minimax_h3",
model_variant="fl2av",
)
pipe.create_generator(config_json="configs/minimax_h3/dmd/minimax_h3_bf16_4step.json")
pipe.generate(
task="t2av",
seed=42,
prompt="A cinematic fox walks through a snowy forest while soft wind and distant birds create an immersive winter soundscape.",
save_result_path="outputs/fox.mp4",
)
如需完整安装可选注意力/量化内核,以及更多示例(NVFP4、卸载、多 GPU 脚本),请参阅 examples/ 和 scripts/ 目录。
📚 文档与社区
- 英文文档: https://lightx2v-en.readthedocs.io/en/latest/
- 中文文档: https://lightx2v-zhcn.readthedocs.io/zh-cn/latest/
- Docker 镜像:
lightx2v/lightx2v - HuggingFace 模型库: https://huggingface.co/lightx2v(蒸馏 LoRA、量化检查点、自动编码器)
- 在线演示: https://x2v.light-ai.top/(无需安装的“LightX2V Studio”)
- 微信群组: LightX2V Robot – ID
random42seed - 贡献指南: 提交 PR 前运行
ruff+pre-commit;README 中列出了众多社区贡献者。
🛠️ 典型应用场景
- 视频生成的快速原型开发 – 开发者可快速搭建 Gradio UI 或 ComfyUI 节点,实验 T2V/T2AV 流水线。
- 生产级推理 – 框架的并行化与量化能力,使在中等规模 GPU 集群上部署高分辨率(720-1080p)视频模型成为可能。
- 多模态扩散研究 – 内置 LoRA 基础的步长蒸馏与自定义 DMD 配置,便于测试新型模型变体。
- 边缘部署 – 支持 T-head PPU、iluvatar、Enflame、MUSA、ROCm、Ascend 等,可在非 NVIDIA 硬件上运行。
📜 许可证
Apache 2.0 – 免费用于商业与学术用途。
总结 – LightX2V 是面向新一代图像与视频扩散/流模型的生产就绪、高度优化的推理栈。它集成了模型库、加速技巧与开箱即用的前端,是任何需要快速、可扩展视频生成的用户的坚实选择。
相关
- 项目
- 项目
- 项目
- 项目
- 项目