WeChatCV/Wan-Alpha

[CVPR 2026 Highlight] High-Quality Text-to-Video Generation with Alpha Channel

What it solves

Wan-Alpha は、安定した透過(アルファチャンネル)を持つ高品質動画の生成の難しさを解決するために設計されました。背景が透過された動画を作成できるため、手動のロトスコーピングなしで他のシーンに統合しやすくなります。

How it works

本プロジェクトは「Shiftable RGB‑A Distribution Learner」を実装し、テキストから RGBA 動画を生成できるようにします。Wan2.1‑T2V‑14B ベースモデル上に構築され、アルファチャンネルを扱うための専用 VAE(変分オートエンコーダ)と LoRA 重みを利用しています。システムはガウスマスクで生成プロセスをガイドし、英語と中国語のプロンプトの両方に対応しています。

Who it’s for

このツールは、AI 研究者、動画編集者、デジタルコンテンツクリエイター向けで、プロフェッショナルな合成に必要な透過機能を備えた高忠実度動画素材を求める方に最適です。

Highlights

  • Stable Transparency: 半透明オブジェクト、発光エフェクト、髪の毛などの細部に対して正確なアルファチャンネルを持つ動画を生成します。
  • HuggingFace Integration: v1.0 と v2.0 のモデルおよび VAE のオープンソース checkpoint を提供します。
  • Training Pipeline: VAE とテキストから RGBA 動画生成モデルのフルトレーニングスクリプトを含みます。
  • Base Model Adaptation: Wan2.1‑14B‑T2V モデルから派生し、動画合成能力を強化しています。