ModelTC/LightX2V
Lightweight Image Video Action Generation Inference Framework
⚡️ LightX2V – 輕量級影片生成推論框架
是什麼 – LightX2V 是一個開源推論引擎,可在單一 GPU 或多 GPU 集群上高效執行最新的影像與影片生成模型(文字到影片、影像到影片、文字到影像、影像到影像等)。它專注於速度:作者提供量化、蒸餾的 LoRA 檢查點,以及一系列部署技巧(卸載、張量/序列平行、FP8/NVFP4 量化、特徵快取),與 Diffusers、FastVideo 或 SGL-Diffusion 等其他框架相比,大幅縮短推論時間。
🎯 核心功能
| 功能 | 詳細 |
|---|---|
| 多模態生成 | 文字到影片(T2V)、影像到影片(I2V)、文字到影像(T2I)、影像到影像(I2I)以及音訊同步影片(T2AV、I2AV、FL2AV、Ref2AV)。 |
| 支援模型 | MiniMax-H3、LTX-2/2.3、HunyuanVideo-1.5、Wan 2.1/2.2、SwiftVR、Qwen-Image/-Edit、Self-Forcing、Matrix-Game-2.0 等。 |
| 加速技巧 | 4步蒸餾 LoRA、CFG 無推論、FP8/NVFP4 量化、區塊級卸載、張量/序列平行、解耦部署(Mooncake、T-head PPU、iluvatar、Enflame、MUSA、ROCm、Ascend 等)。 |
| 基準測試 | 在 H100(8 GPU)上,LightX2V 以 0.35 秒/步(FP8,無 CFG)完成 40 步 81 幀影片生成——比自身基線快約 2 倍,比競爭框架最快快 3.9 倍。 |
| 前端 | Gradio Web UI、ComfyUI 節點式 UI、Windows 一鍵安裝程式。 |
| 打包方式 | Docker 鏡像、pip 可安裝套件、支援可選自訂注意力/量化內核的原始碼建置。 |
🚀 快速上手(快速啟動)
# 直接從倉儲安裝
pip install -v git+https://github.com/ModelTC/LightX2V.git
或克隆並本地建置:
git clone https://github.com/ModelTC/LightX2V.git
cd LightX2V
uv pip install -v . # 或:pip install -v .
執行 MiniMax-H3 文字到音訊影片範例
from lightx2v import LightX2VPipeline
pipe = LightX2VPipeline(
model_path="/path/to/MiniMax-H3",
model_cls="minimax_h3",
model_variant="fl2av",
)
pipe.create_generator(config_json="configs/minimax_h3/dmd/minimax_h3_bf16_4step.json")
pipe.generate(
task="t2av",
seed=42,
prompt="A cinematic fox walks through a snowy forest while soft wind and distant birds create an immersive winter soundscape.",
save_result_path="outputs/fox.mp4",
)
如需完整安裝可選注意力/量化內核,以及更多範例(NVFP4、卸載、多 GPU 腳本),請參閱 examples/ 和 scripts/ 目錄。
📚 文件與社群
- 英文文件: https://lightx2v-en.readthedocs.io/en/latest/
- 中文文件: https://lightx2v-zhcn.readthedocs.io/zh-cn/latest/
- Docker 鏡像:
lightx2v/lightx2v - HuggingFace 模型庫: https://huggingface.co/lightx2v(蒸餾 LoRA、量化檢查點、自動編碼器)
- 線上示範: https://x2v.light-ai.top/(無需安裝的「LightX2V Studio」)
- 微信群組: LightX2V Robot – ID
random42seed - 貢獻指南: 提交 PR 前執行
ruff+pre-commit;README 中列出了許多社群貢獻者。
🛠️ 典型應用場景
- 影片生成的快速原型開發 – 開發者可快速搭建 Gradio UI 或 ComfyUI 節點,實驗 T2V/T2AV 流水線。
- 生產級推論 – 框架的平行化與量化能力,使在中等規模 GPU 集群上部署高解析度(720-1080p)影片模型成為可能。
- 多模態擴散研究 – 內建 LoRA 基礎的步驟蒸餾與自訂 DMD 配置,便於測試新型模型變體。
- 邊緣部署 – 支援 T-head PPU、iluvatar、Enflame、MUSA、ROCm、Ascend 等,可在非 NVIDIA 硬體上運行。
📜 授權條款
Apache 2.0 – 可免費用於商業與學術用途。
總結 – LightX2V 是面向新一代影像與影片擴散/流模型的生產就緒、高度優化的推論堆疊。它整合了模型資料庫、加速技巧與開箱即用的前端,是任何需要快速、可擴展影片生成的使用者的穩健選擇。
相關
- 專案
- 專案
- 專案
- 專案
- 專案