Saganaki22/ComfyUI-OmniVoice-TTS
OmniVoice TTS nodes for ComfyUI - Zero-shot multilingual text-to-speech with voice cloning, voice design, and multi-speaker dialogue
解決的問題
本專案為 OmniVoice 提供 ComfyUI 節點,OmniVoice 是一個零樣本多語言文本轉語音 (TTS) 系統。它使用戶能夠生成 600 多種語言的高品質語音,實現透過短音訊樣本進行精確的語音克隆,或根據文本描述建立完全合成的語音。
工作原理
該系統使用基於擴散的音訊生成過程。它整合了用於不同 TTS 任務的多個專用節點:
- Voice Cloning: 使用 3-15 秒的參考音訊剪輯來模仿特定聲音。
- Voice Design: 透過文本指令指定性別、年齡、音調和口音等屬性來建立新聲音。
- Longform TTS: 透過智慧分塊處理長文本以保持穩定性。
- Multi-Speaker TTS: 透過使用
[Speaker_N]:標籤為不同聲音分配台詞來生成對話。 - Whisper Integration: 使用 OpenAI 的 Whisper ASR 自動轉錄參考音訊,以提高克隆準確度。
為了優化效能,它支援用於在相容 GPU (SM80+) 上進行更快推理的 SageAttention CUDA 核心、用於節省 VRAM 的自動 CPU 卸載,以及多種精度模式 (fp32, bf16, fp16)。
適用對象
使用 ComfyUI 的內容創作者、開發人員和 AI 藝術家,他們需要專業級的多語言語音合成、語音克隆和對話生成,而無需訓練自己的模型。
亮點
- 海量語言支援: 支援 600 多種語言。
- 零樣本克隆: 僅需 3-15 秒的音訊即可克隆聲音。
- 豐富的表達控制: 包括非語言標籤(例如
[laughter],[sigh])和特定的方言/風格指令。 - 高效率: 提供比實時快高達 40 倍的推理速度 (RTF 0.025)。
- 靈活的 VRAM 使用: 支援自動 CPU 卸載和量化模型 (bf16),可在低階硬體上執行。
相關
- 專案
- 專案
- 專案
- 專案
- 專案