Wan-Video/Wan2.2
Wan: Open and Advanced Large-Scale Video Generative Models
解決的問題
Wan2.2 是一套大規模視頻生成模型,旨在從文字、影像或語音生成高品質、電影級的影片。它解決了在維持計算效率的同時,生成具有複雜運動、精確美學控制與高解析度(最高 720P)影片的挑戰。
工作原理
本專案在其視頻擴散模型中採用 Mixture-of-Experts(MoE)架構,透過在不同去噪時間步使用專門的專家模型來提升模型容量,而無需增加計算成本。它在大規模影像與影片資料集上進行訓練,包含精心篩選的美學資料,以更好地控制光影與構圖。為實現高效生成,使用具有 16x16x4 壓縮比的專用 VAE。
適用對象
本專案適用於 AI 視頻生成領域的研究人員與開發者,以及需要在高階 GPU 和消費級硬體(如 RTX 4090)上運行的高解析度、電影級視頻合成工具的產業創作者。
主要亮點
- 多模態輸入:支援文字到影片(T2V)、影像到影片(I2V)、文字-影像到影片(TI2V)和語音到影片(S2V)。
- 電影級控制:提供光照、色調與構圖的詳細標籤,實現精確的美學客製化。
- 高效高解析度:5B 模型可在消費級顯卡上實現 720P@24fps 的生成。
- 高階動畫:包含專門用於角色動畫與替換的模型,支援整體動作的精準複製。
- 可擴展推論:支援使用 PyTorch FSDP 和 DeepSpeed Ulysses 的單 GPU 與多 GPU 推論。
相關
- 專案
- 專案
- 專案
- 專案