Wan-Video/Wan2.2

Wan: Open and Advanced Large-Scale Video Generative Models

解決的問題

Wan2.2 是一套大規模視頻生成模型,旨在從文字、影像或語音生成高品質、電影級的影片。它解決了在維持計算效率的同時,生成具有複雜運動、精確美學控制與高解析度(最高 720P)影片的挑戰。

工作原理

本專案在其視頻擴散模型中採用 Mixture-of-Experts(MoE)架構,透過在不同去噪時間步使用專門的專家模型來提升模型容量,而無需增加計算成本。它在大規模影像與影片資料集上進行訓練,包含精心篩選的美學資料,以更好地控制光影與構圖。為實現高效生成,使用具有 16x16x4 壓縮比的專用 VAE。

適用對象

本專案適用於 AI 視頻生成領域的研究人員與開發者,以及需要在高階 GPU 和消費級硬體(如 RTX 4090)上運行的高解析度、電影級視頻合成工具的產業創作者。

主要亮點

  • 多模態輸入:支援文字到影片(T2V)、影像到影片(I2V)、文字-影像到影片(TI2V)和語音到影片(S2V)。
  • 電影級控制:提供光照、色調與構圖的詳細標籤,實現精確的美學客製化。
  • 高效高解析度:5B 模型可在消費級顯卡上實現 720P@24fps 的生成。
  • 高階動畫:包含專門用於角色動畫與替換的模型,支援整體動作的精準複製。
  • 可擴展推論:支援使用 PyTorch FSDP 和 DeepSpeed Ulysses 的單 GPU 與多 GPU 推論。

相關

  • 專案
  • 專案
  • 專案
  • 專案