WeChatCV/Wan-Alpha
[CVPR 2026 Highlight] High-Quality Text-to-Video Generation with Alpha Channel
What it solves
Wan-Alpha 는 안정적인 투명도(alpha 채널)를 가진 고품질 비디오를 생성하는 어려움을 해결하도록 설계되었습니다. 배경이 투명한 비디오를 만들 수 있어 수동 로토스코핑 없이 다른 장면에 쉽게 통합할 수 있습니다.
How it works
이 프로젝트는 "Shiftable RGB‑A Distribution Learner" 를 구현하여 텍스트‑to‑RGBA 비디오 생성을 가능하게 합니다. Wan2.1‑T2V‑14B 기반 모델 위에 구축되었으며, 알파 채널을 처리하기 위해 특수 VAE(Variational Autoencoder)와 LoRA 가중치를 사용합니다. 시스템은 가우시안 마스크를 사용해 생성 과정을 안내하고, 영어와 중국어 프롬프트를 모두 지원합니다.
Who it’s for
이 도구는 AI 연구자, 비디오 편집자 및 디지털 콘텐츠 제작자를 위한 것으로, 전문 합성을 위해 내장 투명도를 갖춘 고충실도 비디오 자산이 필요한 사람들을 대상으로 합니다.
Highlights
- Stable Transparency: 반투명 객체, 발광 효과, 머리카락과 같은 섬세한 디테일에 정확한 알파 채널을 가진 비디오를 생성합니다.
- HuggingFace Integration: v1.0 및 v2.0 모델과 VAE에 대한 오픈소스 체크포인트를 제공합니다.
- Training Pipeline: VAE와 텍스트‑to‑RGBA 비디오 생성 모델에 대한 전체 학습 스크립트를 포함합니다.
- Base Model Adaptation: Wan2.1‑14B‑T2V 모델을 기반으로 하여 비디오 합성 능력을 향상시켰습니다.