OmniCustom-project/OmniCustom
Official Implementation of 'OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model'
解决的问题
OmniCustom 解决了音视频同步定制的挑战。它允许用户生成一个保持特定人物视觉身份的视频,同时生成模仿特定人物声音音色的音频轨道,而实际的语音内容则由文本提示控制。
工作原理
该框架使用从 OVI 微调而来的联合音视频生成模型。它集成了多个专用组件来处理不同模态:
- 视觉身份:使用 InsightFace 提取 512 维人脸嵌入,并通过 LivePortrait 裁剪参考图像。
- 声音音色:使用 Naturalspeech 3 提取 256 维音色嵌入。
- 音频生成:使用 MMAudio 的 Audio VAE。
- 视频生成:视频分支从 Wan2.2 初始化。
用户需提供参考图像、参考音频片段和文本提示以指导最终输出。
适用人群
希望创建高度定制化、同步的说话头视频的内容创作者和开发者,其中外观和声音均基于现实世界参考。
亮点
- 联合生成:同步生成音视频,而非将其视为独立步骤。
- 身份保留:保持来自参考图像的视觉身份和来自参考音频片段的语音音色。
- 文本驱动内容:通过文本提示自由指定语音内容。
- 多模型集成:融合了 OVI、Wan2.2、MMAudio 和 InsightFace 的优势。
相关
- 项目
- 项目
- 项目
- 项目
- 项目