aigc-apps/VideoX-Fun

📹 A more flexible framework that can generate videos at any resolution and creates videos from images.

解決的問題

VideoX-Fun 提供了一個完整的高品質 AI 影片與影像生成流程。它解決了可控影片生成的挑戰——允許使用者指定起始與結束幀,使用參考影片進行風格轉移,或應用精確的結構控制(如 Canny 邊緣、深度圖或人體姿勢)來引導生成內容的運動與構圖。

工作原理

本專案採用擴散變換器(DiT)架構,特別支援 CogVideoX-Fun 與 Wan 2.1 系列模型。提供多種生成模式:

  • 文字到影片 (T2V):從文字提示生成影片。
  • 影像到影片 (I2V):使用一張或兩張影像(起始幀與結束幀)來動畫化場景。
  • 影片到影片 (V2V):使用參考影片來引導生成新影片。
  • 受控生成:使用控制模型強制執行特定條件,如 Canny、姿勢、深度與 MLSD,以及相機移動控制(上下左右平移)。

為優化消費級 GPU 上的效能,實作了記憶體管理策略,包括 CPU 離線與 float8 量化。

適用對象

此工具專為希望對運動與風格擁有高度控制能力的 AI 藝術家、內容創作者與開發者設計。也適合希望訓練自己基線或 LoRA 模型以實現特定風格轉換的研究人員。

主要亮點

  • 多模型支援:整合支援 CogVideoX-Fun 與 Wan 2.1 系列(1.3B 與 14B 模型)。
  • 精確控制:支援相機軌跡控制與結構引導(Canny、深度、姿勢)。
  • 自訂訓練:可訓練基線與 LoRA 模型,包含用於人類偏好最佳化的 Reward LoRA 支援。
  • 彈性部署:可透過 ComfyUI、Docker 或直接 Python 指令碼使用,支援 Windows 與 Linux。

相關

  • 專案
  • Dispatch
  • 專案
  • 專案
  • 專案