Correr-Zhou/OmniShow
[ICML 2026] ByteDance's All-in-One Video Generation Model for Human-Object Interaction Video Generation
해결하는 문제
OmniShow는 텍스트, 이미지, 오디오, 자세와 같은 다양한 제어 신호를 사용하여 인간과 물체 간의 상호작용을 재현하는 고해상도 영상 생성 문제(인간-물체 상호작용 영상 생성, HOIVG)를 해결하기 위해 설계되었습니다. 기존 모델은 텍스트, 이미지, 오디오, 자세와 같은 다양한 모달리티를 하나의 프레임워크로 통합하는 데 어려움을 겪었으며, 시각적 일관성과 동기화를 유지하기 어려웠습니다.
작동 방식
OmniShow는 Wan 모델 기반의 통합 프레임워크를 사용하여 다양한 입력을 처리합니다:
- 통합 채널별 조건부 입력: 참조 이미지와 자세 신호를 채널로 연결하여 삽입하고, 가상 프레임과 재구성 손실을 사용하여 의미적 세부 정보를 유지합니다.
- 게이트형 로컬 컨텍스트 어텐션: 마스크된 어텐션과 적응형 게이팅을 사용하여 오디오 특징과 영상 프레임을 정렬하여 오디오와 시각 요소의 동기화를 보장합니다.
- 분리 후 통합 학습: 먼저 참조→영상(R2V), 오디오→영상(A2V) 등의 전문화된 하위 작업에서 학습한 후, 가중치 보간과 공동 미세조정을 통해 모든 기능을 하나의 모델로 통합합니다.
대상 사용자
이 프로젝트는 인간 중심 콘텐츠, 오디오 기반 아바타, 제어 가능한 영상 합성에 집중하는 연구자 및 개발자에게 적합합니다.
주요 특징
- 일체형 모델: 텍스트, 참조 이미지, 오디오, 자세 조건을 동시에 지원합니다.
- 유연한 작업 커버리지: R2V(참조), RA2V(참조 + 오디오), RP2V(참조 + 자세), RAP2V(참조 + 오디오 + 자세) 등 다양한 생성 모드를 처리합니다.
- 포괄적인 벤치마크: 다중 모달 HOIVG 전용 데이터셋과 평가 도구인 HOIVG-Bench를 도입했습니다.
- 다양한 응용 가능성: 물체 교체, 영상 리믹스, 오디오 기반 아바타 생성이 가능합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트