OmniCustom-project/OmniCustom

Official Implementation of 'OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model'

解决的问题

OmniCustom 解决了音视频同步定制的挑战。它允许用户生成一个保持特定人物视觉身份的视频,同时生成模仿特定人物声音音色的音频轨道,而实际的语音内容则由文本提示控制。

工作原理

该框架使用从 OVI 微调而来的联合音视频生成模型。它集成了多个专用组件来处理不同模态:

  • 视觉身份:使用 InsightFace 提取 512 维人脸嵌入,并通过 LivePortrait 裁剪参考图像。
  • 声音音色:使用 Naturalspeech 3 提取 256 维音色嵌入。
  • 音频生成:使用 MMAudio 的 Audio VAE。
  • 视频生成:视频分支从 Wan2.2 初始化。

用户需提供参考图像、参考音频片段和文本提示以指导最终输出。

适用人群

希望创建高度定制化、同步的说话头视频的内容创作者和开发者,其中外观和声音均基于现实世界参考。

亮点

  • 联合生成:同步生成音视频,而非将其视为独立步骤。
  • 身份保留:保持来自参考图像的视觉身份和来自参考音频片段的语音音色。
  • 文本驱动内容:通过文本提示自由指定语音内容。
  • 多模型集成:融合了 OVI、Wan2.2、MMAudio 和 InsightFace 的优势。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目