Saganaki22/ComfyUI-OmniVoice-TTS

OmniVoice TTS nodes for ComfyUI - Zero-shot multilingual text-to-speech with voice cloning, voice design, and multi-speaker dialogue

解决的问题

本项目为 OmniVoice 提供 ComfyUI 节点,OmniVoice 是一个零样本多语言文本转语音 (TTS) 系统。它使用户能够生成 600 多种语言的高质量语音,实现通过短音频样本进行精确的语音克隆,或根据文本描述创建完全合成的语音。

工作原理

该系统使用基于扩散的音频生成过程。它集成了用于不同 TTS 任务的多个专用节点:

  • Voice Cloning: 使用 3-15 秒的参考音频剪辑来模仿特定声音。
  • Voice Design: 通过文本指令指定性别、年龄、音调和口音等属性来创建新声音。
  • Longform TTS: 通过智能分块处理长文本以保持稳定性。
  • Multi-Speaker TTS: 通过使用 [Speaker_N]: 标签为不同声音分配台词来生成对话。
  • Whisper Integration: 使用 OpenAI 的 Whisper ASR 自动转录参考音频,以提高克隆准确度。

为了优化性能,它支持用于在兼容 GPU (SM80+) 上进行更快推理的 SageAttention CUDA 内核、用于节省 VRAM 的自动 CPU 卸载,以及多种精度模式 (fp32, bf16, fp16)。

适用对象

使用 ComfyUI 的内容创作者、开发人员和 AI 艺术家,他们需要专业级的多语言语音合成、语音克隆和对话生成,而无需训练自己的模型。

亮点

  • 海量语言支持: 支持 600 多种语言。
  • 零样本克隆: 仅需 3-15 秒的音频即可克隆声音。
  • 丰富的表达控制: 包括非语言标签(例如 [laughter], [sigh])和特定的方言/风格指令。
  • 高效率: 提供比实时快高达 40 倍的推理速度 (RTF 0.025)。
  • 灵活的 VRAM 使用: 支持自动 CPU 卸载和量化模型 (bf16),可在低端硬件上运行。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目