WeChatCV/Wan-Alpha

[CVPR 2026 Highlight] High-Quality Text-to-Video Generation with Alpha Channel

What it solves

Wan-Alpha 旨在解决生成高质量、透明度(alpha 通道)稳定视频的难题。它允许创建背景透明的视频,使这些视频更容易集成到其他场景中,无需手动 rotoscoping。

How it works

项目实现了“可平移的 RGB‑A 分布学习器”,以支持文本到 RGBA 视频的生成。它基于 Wan2.1‑T2V‑14B 基础模型,并使用专门的 VAE(变分自编码器)和 LoRA 权重来处理 alpha 通道。系统使用高斯掩码引导生成过程,支持英文和中文提示词。

Who it’s for

此工具面向 AI 研究者、视频编辑者和数字内容创作者,需在专业合成中使用内置透明度的高保真视频资产。

Highlights

  • Stable Transparency: 生成具有精确 alpha 通道的视频,适用于半透明对象、发光效果以及头发等细节。
  • HuggingFace Integration: 提供 v1.0 与 v2.0 模型及 VAE 的开源 checkpoints。
  • Training Pipeline: 包含 VAE 与文本到 RGBA 视频生成模型的完整训练脚本。
  • Base Model Adaptation: 从 Wan2.1‑14B‑T2V 模型改编,以提升视频合成能力。