nxnai/Voost

[SIGGRAPH Asia 25] Voost: A Unified and Scalable Diffusion Transformer for Bidirectional Virtual Try-On and Try-Off

What it solves

Voost 是設計來同時處理虛擬試穿(將服裝加到人物身上)與虛擬脫衣(從人物身上移除服裝)的單一統一模型。它旨在提供高品質、寫實的結果,且在不同的人體姿勢、服裝類型、背景與光照條件下都能保持穩健。

How it works

Voost 採用可擴展的 Diffusion Transformer(DiT)架構來處理雙向影像操作。這使得模型能在同一個 transformer 框架內共同管理「添加」與「移除」服裝的任務,確保在各種影像組合下的連貫性與品質。

Who it’s for

此專案適合從事電腦視覺、數位時尚與 AI 驅動影像編輯的研究人員與開發者,特別是關注虛擬試穿與脫衣技術的族群。

Highlights

  • 統一的框架,同時支援虛擬試穿與脫衣。
  • 基於可擴展的 Diffusion Transformer 架構。
  • 對人體姿勢、服裝類別與光照變化具備韌性。
  • 在 Hugging Face Spaces 上提供公開示範。