diodiogod/TTS-Audio-Suite

A ComfyUI custom node integration for local multi-engine multi-language Text-to-Speech and Voice Conversion. Supports: RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio EditX, IndexTTS-2, Chatterbox (classic and multilingual), F5-TTS, Higgs Audio 2, 3, and VibeVoice with unlimited text length, SRT timing, Character support, and many audio tools

它解決的問題

TTS Audio Suite 是一個全面的 ComfyUI 延伸模組,將大量文字轉語音(TTS)、語音轉換(VC)和自動語音辨識(ASR)引擎整合至單一模組化介面。它透過提供高品質語音合成、語音克隆以及字幕同步音訊生成的中央控制中心,解決了音訊 AI 工具的碎片化問題,同時透過執行時期隔離來管理不同 AI 模型的複雜相依性需求。

如何運作

該套件將 19 種不同的引擎(包括 F5-TTS、Higgs Audio、MOSS-TTS 和 RVC)整合至 ComfyUI 節點。它採用模組化架構,讓現代引擎能在主要的 Transformers 5 環境中執行,同時將脆弱的舊版堆疊隔離於專用執行環境中,以防止相依性衝突。針對字幕工作,它會處理 SRT 檔案以產生同步音訊,並使用「smart_natural」時間邏輯來避免重疊,確保語音流暢自然。

適用對象

專為 ComfyUI 使用者、內容創作者和動畫師設計,適合需要專業級配音、精確字幕定時、語音克隆,或在節點式工作流程中進行自動轉錄與音訊編輯的使用者。

主要特色

  • 廣泛的引擎支援:整合 19 種引擎,涵蓋數百種語言的 TTS、語音轉換與 ASR。
  • SRT 整合:專用節點可從 SRT 檔案生成 TTS,具備精確定時與段落級快取功能。
  • 執行時期隔離:透過分離現代與舊版模型環境,防止相依性死結。
  • 進階音訊工具:包含以提示為基礎的視覺標籤建構器、基於口部動作的靜音語音分析器,以及內建的 RVC 模型訓練功能。
  • 語音設計:提供工具,可使用 Qwen3-TTS 和 OmniVoice 等相容引擎建立可重複使用的語音。

這套工具讓語音合成變得前所未有的簡單與強大,特別是對於需要精確字幕同步的動畫製作。 — @handle

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案