caiyuanhao1998/Open-OmniVCus

OmniVCus: Feedforward Subject-driven Video Customization with Multimodal Control Conditions (NeurIPS 2025)

解决的问题

OmniVCus 解决了主题驱动的视频定制挑战,允许用户生成包含特定主题(由参考图像定义)的视频,同时通过深度图、掩码、运动(光流)和相机位姿等多种多模态控制条件,精确控制视频内容。

工作原理

该项目采用扩散Transformer(DiT)架构和专用的数据构建流水线。通过将深度图、掩码、运动(光流)和相机位姿等多模态控制条件整合到生成过程中,实现前馈式主题定制。实现中利用了 Lottery Embedding(LE)和 Temporally Aligned Embedding(TAE)来有效处理这些控制信号。其基础模型包括 Wan2.1 和 Wan2.2。

适用人群

本工具专为希望在严格结构或运动约束下生成具有稳定主题的AI视频的研究人员和开发者设计。

核心亮点

  • 多模态控制:支持深度、掩码和运动等多种控制条件。
  • 主题驱动:使用参考图像确保生成视频中主题的一致性。
  • 完整流水线:包含数据构建工厂(VideoCus-Factory),可从原始视频创建所需的多模态配对数据。
  • 灵活模型规模:提供基于不同模型规模的实现,包括 1.3B 和 14B 参数版本。

相关

  • 项目
  • 项目
  • 项目
  • 项目