OmniCustom-project/OmniCustom
Official Implementation of 'OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model'
解決的問題
OmniCustom 解決了音訊與影像同步客製化的挑戰。它允許使用者產生維持特定人物視覺身份的影片,同時產生模仿特定人物聲音音色的音訊軌道,而實際的語音內容則由文字提示控制。
工作原理
此框架使用從 OVI 微調而來的聯合音訊與影像生成模型。它整合了多個專用元件來處理不同模態:
- 視覺身份:使用 InsightFace 提取 512 維臉部嵌入,並透過 LivePortrait 裁剪參考影像。
- 聲音音色:使用 Naturalspeech 3 提取 256 維音色嵌入。
- 音訊生成:使用 MMAudio 的 Audio VAE。
- 影像生成:影像分支從 Wan2.2 初始化。
使用者需提供參考影像、參考音訊片段與文字提示以指導最終輸出。
適用對象
希望創造高度客製化、同步的說話頭影片的內容創作者與開發者,其中外觀與聲音皆基於現實世界參考。
亮點
- 聯合生成:同步產生音訊與影像,而非視為獨立步驟。
- 身份保留:維持來自參考影像的視覺身份與來自參考音訊片段的聲音音色。
- 文字驅動內容:透過文字提示自由指定語音內容。
- 多模型整合:融合 OVI、Wan2.2、MMAudio 與 InsightFace 的優勢。
相關
- 專案
- 專案
- 專案
- 專案
- 專案