caiyuanhao1998/Open-OmniVCus

OmniVCus: Feedforward Subject-driven Video Customization with Multimodal Control Conditions (NeurIPS 2025)

解決的問題

OmniVCus 解決了主題驅動的影片客製化挑戰,允許使用者生成包含特定主題(由參考影像定義)的影片,同時透過深度圖、遮罩、運動(光流)和相機姿態等多模態控制條件,精確控制影片內容。

工作原理

本專案採用擴散Transformer(DiT)架構與專用的資料建構流程。透過將深度圖、遮罩、運動(光流)和相機姿態等多模態控制條件整合至生成過程中,實現前饋式主題客製化。實作上利用Lottery Embedding(LE)與Temporally Aligned Embedding(TAE)有效處理這些控制訊號。其基礎模型包含Wan2.1與Wan2.2。

適用對象

本工具專為希望在嚴格結構或運動限制下生成具一致主題的AI影片之研究人員與開發者設計。

核心亮點

  • 多模態控制:支援深度、遮罩與運動等多種控制條件。
  • 主題驅動:使用參考影像確保生成影片中主題的一致性。
  • 完整流程:包含資料建構工廠(VideoCus-Factory),可從原始影片建立所需的多模態配對資料。
  • 彈性模型規模:提供基於不同模型規模的實作,包含1.3B與14B參數版本。

相關

  • 專案
  • 專案
  • 專案
  • 專案