Correr-Zhou/OmniShow
[ICML 2026] ByteDance's All-in-One Video Generation Model for Human-Object Interaction Video Generation
What it solves
OmniShow는 Human-Object Interaction Video Generation (HOIVG) 를 위해 설계되었습니다. 인간이 객체와 상호작용하는 고품질 영상을 생성하는 문제를 해결하고, 텍스트, 사람 및 객체의 레퍼런스 이미지, 오디오, 포즈 시퀀스와 같은 여러 입력(멀티모달 조건)을 동시에 사용해 출력을 제어할 수 있게 합니다.
How it works
OmniShow는 통합 프레임워크를 사용해 다양한 생성 작업(R2V, RA2V, RP2V, RAP2V)을 처리합니다. 핵심 기술 요소는 다음 세 가지입니다.
- Unified Channel-wise Conditioning: 레퍼런스 이미지와 포즈 정보를 비디오 토큰에 연결하고, 의사 프레임(pseudo‑frames)과 재구성 손실을 사용해 의미적 디테일을 유지합니다.
- Gated Local-Context Attention: 오디오 특징을 컨텍스트와 함께 패킹하고, 마스크드 어텐션과 적응 게이팅을 사용해 비디오 프레임과 오디오 구간을 정렬함으로써 오디오-비주얼 동기화를 보장합니다.
- Decoupled-Then-Joint Training: 모델은 단계적으로 학습됩니다. 먼저 레퍼런스‑to‑비디오(R2V)와 오디오‑to‑비디오(A2V) 전용 모델을 별도 데이터셋에서 학습한 뒤, 가중치 보간을 통해 결합하고 최종적으로 공동 미세조정합니다.
Who it’s for
이 프로젝트는 제어 가능한 비디오 생성, 디지털 아바타, 멀티모달 AI에 관심 있는 연구자 및 개발자를 위한 것으로, 특히 현실적인 인간‑객체 상호작용을 만들고자 하는 사람들을 대상으로 합니다.
Highlights
- All-in-one Model: 텍스트, 레퍼런스 이미지, 오디오, 포즈 조건을 통합한 최초의 HOIVG 모델.
- Flexible Task Support: Reference+Audio+Pose‑to‑Video (RAP2V)를 포함한 다양한 구성을 지원.
- Comprehensive Benchmark: 멀티모달 HOIVG 평가를 위한 전용 데이터셋 HOIVG‑Bench를 소개.
- Versatile Applications: 오디오 기반 아바타, 객체 교체, 비디오 리믹싱 등 다양한 응용이 가능합니다.