aigc-apps/VideoX-Fun
📹 A more flexible framework that can generate videos at any resolution and creates videos from images.
解決的問題
VideoX-Fun 提供了一個完整的高品質 AI 影片與影像生成流程。它解決了可控影片生成的挑戰——允許使用者指定起始與結束幀,使用參考影片進行風格轉移,或應用精確的結構控制(如 Canny 邊緣、深度圖或人體姿勢)來引導生成內容的運動與構圖。
工作原理
本專案採用擴散變換器(DiT)架構,特別支援 CogVideoX-Fun 與 Wan 2.1 系列模型。提供多種生成模式:
- 文字到影片 (T2V):從文字提示生成影片。
- 影像到影片 (I2V):使用一張或兩張影像(起始幀與結束幀)來動畫化場景。
- 影片到影片 (V2V):使用參考影片來引導生成新影片。
- 受控生成:使用控制模型強制執行特定條件,如 Canny、姿勢、深度與 MLSD,以及相機移動控制(上下左右平移)。
為優化消費級 GPU 上的效能,實作了記憶體管理策略,包括 CPU 離線與 float8 量化。
適用對象
此工具專為希望對運動與風格擁有高度控制能力的 AI 藝術家、內容創作者與開發者設計。也適合希望訓練自己基線或 LoRA 模型以實現特定風格轉換的研究人員。
主要亮點
- 多模型支援:整合支援 CogVideoX-Fun 與 Wan 2.1 系列(1.3B 與 14B 模型)。
- 精確控制:支援相機軌跡控制與結構引導(Canny、深度、姿勢)。
- 自訂訓練:可訓練基線與 LoRA 模型,包含用於人類偏好最佳化的 Reward LoRA 支援。
- 彈性部署:可透過 ComfyUI、Docker 或直接 Python 指令碼使用,支援 Windows 與 Linux。
相關
- 專案
- Dispatch
- 專案
- 專案
- 專案