nxnai/Voost
[SIGGRAPH Asia 25] Voost: A Unified and Scalable Diffusion Transformer for Bidirectional Virtual Try-On and Try-Off
What it solves
Voost 是設計來同時處理虛擬試穿(將服裝加到人物身上)與虛擬脫衣(從人物身上移除服裝)的單一統一模型。它旨在提供高品質、寫實的結果,且在不同的人體姿勢、服裝類型、背景與光照條件下都能保持穩健。
How it works
Voost 採用可擴展的 Diffusion Transformer(DiT)架構來處理雙向影像操作。這使得模型能在同一個 transformer 框架內共同管理「添加」與「移除」服裝的任務,確保在各種影像組合下的連貫性與品質。
Who it’s for
此專案適合從事電腦視覺、數位時尚與 AI 驅動影像編輯的研究人員與開發者,特別是關注虛擬試穿與脫衣技術的族群。
Highlights
- 統一的框架,同時支援虛擬試穿與脫衣。
- 基於可擴展的 Diffusion Transformer 架構。
- 對人體姿勢、服裝類別與光照變化具備韌性。
- 在 Hugging Face Spaces 上提供公開示範。