Saganaki22/ComfyUI-OmniVoice-TTS

OmniVoice TTS nodes for ComfyUI - Zero-shot multilingual text-to-speech with voice cloning, voice design, and multi-speaker dialogue

解決的問題

本專案為 OmniVoice 提供 ComfyUI 節點,OmniVoice 是一個零樣本多語言文本轉語音 (TTS) 系統。它使用戶能夠生成 600 多種語言的高品質語音,實現透過短音訊樣本進行精確的語音克隆,或根據文本描述建立完全合成的語音。

工作原理

該系統使用基於擴散的音訊生成過程。它整合了用於不同 TTS 任務的多個專用節點:

  • Voice Cloning: 使用 3-15 秒的參考音訊剪輯來模仿特定聲音。
  • Voice Design: 透過文本指令指定性別、年齡、音調和口音等屬性來建立新聲音。
  • Longform TTS: 透過智慧分塊處理長文本以保持穩定性。
  • Multi-Speaker TTS: 透過使用 [Speaker_N]: 標籤為不同聲音分配台詞來生成對話。
  • Whisper Integration: 使用 OpenAI 的 Whisper ASR 自動轉錄參考音訊,以提高克隆準確度。

為了優化效能,它支援用於在相容 GPU (SM80+) 上進行更快推理的 SageAttention CUDA 核心、用於節省 VRAM 的自動 CPU 卸載,以及多種精度模式 (fp32, bf16, fp16)。

適用對象

使用 ComfyUI 的內容創作者、開發人員和 AI 藝術家,他們需要專業級的多語言語音合成、語音克隆和對話生成,而無需訓練自己的模型。

亮點

  • 海量語言支援: 支援 600 多種語言。
  • 零樣本克隆: 僅需 3-15 秒的音訊即可克隆聲音。
  • 豐富的表達控制: 包括非語言標籤(例如 [laughter], [sigh])和特定的方言/風格指令。
  • 高效率: 提供比實時快高達 40 倍的推理速度 (RTF 0.025)。
  • 靈活的 VRAM 使用: 支援自動 CPU 卸載和量化模型 (bf16),可在低階硬體上執行。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案