OmniCustom-project/OmniCustom

Official Implementation of 'OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model'

해결하는 문제

OmniCustom은 동기화된 오디오-비디오 커스터마이징의 과제를 해결합니다. 사용자는 특정 사람의 시각적 정체성과 특정 사람의 목소리 톤을 유지하면서, 실제 발화 내용은 텍스트 프롬프트로 제어할 수 있는 비디오를 생성할 수 있습니다.

작동 방식

이 프레임워크는 OVI에서 미세조정된 통합 오디오-비디오 생성 모델을 사용합니다. 다양한 모달리티를 처리하기 위해 여러 전문 컴포넌트를 통합합니다:

  • 시각적 정체성: InsightFace를 사용하여 512차원 얼굴 임베딩을 추출하고, LivePortrait를 통해 참조 이미지를 자릅니다.
  • 목소리 톤: Naturalspeech 3를 사용하여 256차원 톤 임베딩을 추출합니다.
  • 오디오 생성: MMAudio의 Audio VAE를 사용합니다.
  • 비디오 생성: 비디오 브랜치는 Wan2.2에서 초기화됩니다.

사용자는 참조 이미지, 참조 오디오 클립, 그리고 최종 출력을 안내하는 텍스트 프롬프트를 제공합니다.

대상 사용자

실제 세계의 참조 기반으로 외모와 목소리가 모두 커스터마이징된 동기화된 대화형 헤드 비디오를 만들고자 하는 콘텐츠 크리에이터 및 개발자입니다.

주요 특징

  • 통합 생성: 오디오와 비디오를 별도의 단계로 다루는 대신, 동기화하여 생성합니다.
  • 정체성 유지: 참조 이미지에서 시각적 정체성과 참조 오디오 클립에서 목소리 톤을 유지합니다.
  • 텍스트 기반 콘텐츠: 발화 내용은 텍스트 프롬프트를 통해 자유롭게 지정할 수 있습니다.
  • 다중 모델 통합: OVI, Wan2.2, MMAudio, InsightFace의 강점을 결합합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트