OmniCustom-project/OmniCustom

Official Implementation of 'OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model'

解決的問題

OmniCustom 解決了音訊與影像同步客製化的挑戰。它允許使用者產生維持特定人物視覺身份的影片,同時產生模仿特定人物聲音音色的音訊軌道,而實際的語音內容則由文字提示控制。

工作原理

此框架使用從 OVI 微調而來的聯合音訊與影像生成模型。它整合了多個專用元件來處理不同模態:

  • 視覺身份:使用 InsightFace 提取 512 維臉部嵌入,並透過 LivePortrait 裁剪參考影像。
  • 聲音音色:使用 Naturalspeech 3 提取 256 維音色嵌入。
  • 音訊生成:使用 MMAudio 的 Audio VAE。
  • 影像生成:影像分支從 Wan2.2 初始化。

使用者需提供參考影像、參考音訊片段與文字提示以指導最終輸出。

適用對象

希望創造高度客製化、同步的說話頭影片的內容創作者與開發者,其中外觀與聲音皆基於現實世界參考。

亮點

  • 聯合生成:同步產生音訊與影像,而非視為獨立步驟。
  • 身份保留:維持來自參考影像的視覺身份與來自參考音訊片段的聲音音色。
  • 文字驅動內容:透過文字提示自由指定語音內容。
  • 多模型整合:融合 OVI、Wan2.2、MMAudio 與 InsightFace 的優勢。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案