lenML/Speech-AI-Forge
🍦 Speech-AI-Forge is a project developed around TTS generation model, implementing an API Server and a Gradio-based WebUI.
解決的問題
Speech-AI-Forge 為各種最先進的文字轉語音 (TTS) 與自動語音辨識 (ASR) 模型提供統一的介面與部署框架。它消除了為不同的語音 AI 模型安裝與管理多個獨立儲存庫的需要,為語音生成、克隆與轉錄提供了一個集中式中心。
工作原理
該專案實現了一個 API 伺服器與一個基於 Gradio 的 WebUI,用於封裝多種語音模型。它支援廣泛的模型,包括 ChatTTS、CosyVoice、FishSpeech、GPT-SoVITS、F5-TTS 與 Qwen3-TTS,以及 Whisper 與 SenseVoice 等 ASR 模型。使用者可以透過 Windows 獨立套件、Google Colab、Docker 或本地安裝進行部署。
適用對象
專為需要高品質 AI 語音合成與轉錄服務,且不想處理管理多個獨立模型環境複雜性的開發者與創作者設計。
亮點
- 多模型支援:整合了眾多 TTS 引擎(如 ChatTTS、CosyVoice、F5-TTS)與 ASR 引擎(Whisper、SenseVoice)。
- 進階語音控制:具有說話人切換、自定義語音上傳、基於參考的克隆以及風格控制功能。
- SSML 支援:包括用於精細控制長文本合成、播客風格多角色音訊以及字幕轉語音生成的工具。
- 語音管理:用於建立、混合與測試自定義語音的工具,包括一個專門的語音資源中心。
- 全面的工具集:包括語音增強器 (ResembleEnhance) 以及用於音訊裁剪與調整的後處理工具。
- 靈活的部署:既提供用於互動式使用的完整 WebUI,也提供用於高吞吐量應用程式的獨立 API 伺服器。
相關
- 專案
- 專案
- 專案
- 專案
- 專案