caiyuanhao1998/Open-OmniVCus
OmniVCus: Feedforward Subject-driven Video Customization with Multimodal Control Conditions (NeurIPS 2025)
解決的問題
OmniVCus 解決了主題驅動的影片客製化挑戰,允許使用者生成包含特定主題(由參考影像定義)的影片,同時透過深度圖、遮罩、運動(光流)和相機姿態等多模態控制條件,精確控制影片內容。
工作原理
本專案採用擴散Transformer(DiT)架構與專用的資料建構流程。透過將深度圖、遮罩、運動(光流)和相機姿態等多模態控制條件整合至生成過程中,實現前饋式主題客製化。實作上利用Lottery Embedding(LE)與Temporally Aligned Embedding(TAE)有效處理這些控制訊號。其基礎模型包含Wan2.1與Wan2.2。
適用對象
本工具專為希望在嚴格結構或運動限制下生成具一致主題的AI影片之研究人員與開發者設計。
核心亮點
- 多模態控制:支援深度、遮罩與運動等多種控制條件。
- 主題驅動:使用參考影像確保生成影片中主題的一致性。
- 完整流程:包含資料建構工廠(
VideoCus-Factory),可從原始影片建立所需的多模態配對資料。 - 彈性模型規模:提供基於不同模型規模的實作,包含1.3B與14B參數版本。
相關
- 專案
- 專案
- 專案
- 專案