caiyuanhao1998/Open-OmniVCus
OmniVCus: Feedforward Subject-driven Video Customization with Multimodal Control Conditions (NeurIPS 2025)
해결하는 문제
OmniVCus는 특정 주제(참조 이미지로 정의됨)를 포함하는 동영상을 생성하면서도 깊이 맵, 마스크, 움직임(광학 흐름), 카메라 자세와 같은 다중 모달 조건을 통해 동영상 콘텐츠를 정밀하게 제어할 수 있는 주제 중심의 동영상 커스터마이징 문제를 해결합니다.
작동 방식
이 프로젝트는 확산 트랜스포머(DiT) 아키텍처와 특화된 데이터 구축 파이프라인을 사용합니다. 깊이 맵, 마스크, 움직임(광학 흐름), 카메라 자세와 같은 다중 모달 제어 조건을 생성 과정에 통합함으로써 피드포워드 주제 커스터마이징을 가능하게 합니다. 이 구현은 러티니 임베딩(LE)과 시간적으로 정렬된 임베딩(TAE)을 활용하여 이러한 제어 신호를 효과적으로 처리합니다. 기반 모델로 Wan2.1 및 Wan2.2을 사용합니다.
대상 사용자
엄격한 구조적 또는 운동적 제약 하에서 일관된 주제를 가진 동영상을 생성하고자 하는 AI 동영상 생성 분야의 연구자 및 개발자에게 적합합니다.
주요 특징
- 다중 모달 제어: 깊이, 마스크, 움직임 등 다양한 제어 조건을 지원합니다.
- 주제 중심: 참조 이미지를 사용하여 생성된 동영상 전체에서 주제의 일관성을 보장합니다.
- 포괄적인 파이프라인: 원시 동영상을 기반으로 다중 모달 쌍을 생성하는 데이터 구축 팩토리(
VideoCus-Factory)를 포함합니다. - 유연한 모델 크기: 1.3B 및 14B 파라미터 버전을 포함한 다양한 모델 규모 기반의 구현을 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트