Saganaki22/ComfyUI-OmniVoice-TTS
OmniVoice TTS nodes for ComfyUI - Zero-shot multilingual text-to-speech with voice cloning, voice design, and multi-speaker dialogue
解决的问题
本项目为 OmniVoice 提供 ComfyUI 节点,OmniVoice 是一个零样本多语言文本转语音 (TTS) 系统。它使用户能够生成 600 多种语言的高质量语音,实现通过短音频样本进行精确的语音克隆,或根据文本描述创建完全合成的语音。
工作原理
该系统使用基于扩散的音频生成过程。它集成了用于不同 TTS 任务的多个专用节点:
- Voice Cloning: 使用 3-15 秒的参考音频剪辑来模仿特定声音。
- Voice Design: 通过文本指令指定性别、年龄、音调和口音等属性来创建新声音。
- Longform TTS: 通过智能分块处理长文本以保持稳定性。
- Multi-Speaker TTS: 通过使用
[Speaker_N]:标签为不同声音分配台词来生成对话。 - Whisper Integration: 使用 OpenAI 的 Whisper ASR 自动转录参考音频,以提高克隆准确度。
为了优化性能,它支持用于在兼容 GPU (SM80+) 上进行更快推理的 SageAttention CUDA 内核、用于节省 VRAM 的自动 CPU 卸载,以及多种精度模式 (fp32, bf16, fp16)。
适用对象
使用 ComfyUI 的内容创作者、开发人员和 AI 艺术家,他们需要专业级的多语言语音合成、语音克隆和对话生成,而无需训练自己的模型。
亮点
- 海量语言支持: 支持 600 多种语言。
- 零样本克隆: 仅需 3-15 秒的音频即可克隆声音。
- 丰富的表达控制: 包括非语言标签(例如
[laughter],[sigh])和特定的方言/风格指令。 - 高效率: 提供比实时快高达 40 倍的推理速度 (RTF 0.025)。
- 灵活的 VRAM 使用: 支持自动 CPU 卸载和量化模型 (bf16),可在低端硬件上运行。
相关
- 项目
- 项目
- 项目
- 项目
- 项目