SandAI-org/MAGI-2-preview
MAGI-2-preview: Scaling Video Generation Models Efficiently
解決的問題
MAGI-2 Preview 旨在實現影片生成的有效擴展。它解決了從文本或圖像提示生成具有同步音訊的高解析度 (1080p) 影片的挑戰,同時透過使用混合專家 (MoE) 架構,在每個 token 時僅啟動一小部分參數,從而優化了運行大規模模型 (114B 參數) 的計算成本。
工作原理
該模型採用兩階段生成過程:magi2_preview 階段在低解析度下對片段進行去噪,magi2_refiner 階段將結果放大至 1080p。它支援文本轉影片 (T2V) 和圖像轉影片 (I2V) 工作流。為了提高輸出品質,它包含一個選用的提示詞增強步驟,由 LLM 將簡短的使用者提示詞重寫為結構化、詳細的描述。
適用對象
本專案面向擁有高端硬體(特別是 8 個 NVIDIA Hopper GPU)並希望生成帶有整合音訊的高品質 10 秒影片片段的研究人員與開發人員。
亮點
- 統一音視頻生成:同時生成影片和聲音,並將其混音到單個輸出文件中。
- 高效擴展:利用 114B 參數模型,每個 token 僅啟動 6B 參數。
- 高解析度:透過兩階段的「預覽-精煉」流水線生成 1080p 影片。
- 靈活輸入:支援文本轉影片和圖像轉影片生成。
相關
- 專案
- 專案
- 專案
- 專案
- 專案