ModelTC/Minimax-H3-Turbo
Distill Minimax-H3 into 4 steps
解決的問題
本專案提供針對 MiniMax-H3 模型優化過的 LoRA 檢查點,以實現更快的影片與音訊生成。它減少產生高品質結果所需的推論步數(NFE),有效「加速」文字轉影片、圖片轉影片以及參考圖轉影片的任務生成流程。
工作原理
使用 4 到 8 步的蒸餾 LoRA 檢查點,讓模型能大幅減少 Transformer 評估次數來生成內容。本專案支援多種任務:
- T2VA/FL2VA:文字轉影片與音訊,或首幀轉影片與音訊。
- Ref2VA:參考圖轉影片與音訊。
包含針對參考圖像的特定縮放策略(match、max、diffusers),以確保輸入與訓練時的解析度和長寬比相符,進而維持視覺一致性。
適用對象
- 使用 MiniMax-H3 進行影片生成的 AI 藝術家與開發者。
- 使用 Diffusers 套件或 ComfyUI 且希望在不犧牲太多品質的前提下縮短推論時間的使用者。
主要亮點
- 快速推論:提供 4 步與 8 步的加速模型,加快生成速度。
- 彈性整合:提供適用於 Diffusers 與 ComfyUI 的檢查點與工作流程。
- 多任務支援:支援文字轉影片、圖片轉影片以及參考式影片生成,並附帶音訊。
- 解析度選項:包含在不同解析度(如 544p 和 768p)下訓練的模型。
相關
- Dispatch
- 專案
- 專案
- 專案
- 專案