WeChatCV/Wan-Alpha
[CVPR 2026 Highlight] High-Quality Text-to-Video Generation with Alpha Channel
What it solves
Wan-Alpha 旨在解決產生高品質、透明度(alpha 通道)穩定影片的困難。它允許製作背景透明的影片,讓這些影片更容易在其他場景中整合,無需手動 rotoscoping。
How it works
此專案實作「可平移的 RGB‑A 分佈學習器」以支援文字到 RGBA 影片的生成。它以 Wan2.1‑T2V‑14B 基礎模型為基礎,並使用專門的 VAE(變分自編碼器)與 LoRA 權重來處理 alpha 通道。系統利用高斯遮罩引導生成過程,並支援英文與中文提示詞。
Who it’s for
此工具適用於 AI 研究者、影片編輯者與數位內容創作者,需用於專業合成的高保真影片素材且內建透明度。
Highlights
- Stable Transparency: 產生具有精確 alpha 通道的影片,適用於半透明物件、發光效果以及頭髮等細節。
- HuggingFace Integration: 提供 v1.0 與 v2.0 模型及 VAE 的開源 checkpoint。
- Training Pipeline: 包含 VAE 與文字到 RGBA 影片生成模型的完整訓練腳本。
- Base Model Adaptation: 從 Wan2.1‑14B‑T2V 模型改編,以提升影片合成能力。