KoljaB/RealtimeTTS
Converts text to speech in realtime
解決的問題
RealtimeTTS 解決了文字轉語音(TTS)系統通常伴隨的高延遲問題,特別適用於需要將字串、產生器或即時 LLM 標記串流轉換為音訊的應用程式。它提供統一的介面,處理串流音訊播放與引擎管理的複雜性。
工作原理
該程式庫作為大量 TTS 引擎的包裝器,允許開發者將文字輸入至串流中,該串流可於本地播放、串流至其他程序,或儲存為 WAV 檔案。支援同步與非同步播放,並能處理透過迭代器傳入的分塊文字,以確保音訊盡可能快地開始播放。同時也包含句子分割邏輯,以優化語音流暢度。
適用對象
專為開發對話式 AI、語音助理,或任何需要從動態文字來源實現低延遲、高品質語音合成之應用程式的開發者所設計。
主要特色
- 廣泛的引擎支援:整合本地神經模型(如 QwenEngine 和 Coqui)、雲端 API(OpenAI、Azure、Elevenlabs)以及系統語音。
- 低延遲:針對快速的「首個標記時間」(TTFT)與最小可聽啟動延遲進行優化,特別是使用推薦的 QwenEngine 時。
- 彈性輸出:支援本地喇叭播放、WAV 檔案匯出,以及適用於生產環境的無頭 HTTP 伺服器模式。
- 進階控制:包含語音克隆、可靠性保障的備用引擎,以及用於字詞時序與音訊區塊的詳細回呼功能。
- LLM 整合:專門設計用於處理來自 LLM 的標記串流,以最小化文字生成與語音之間的延遲差距。
相關
- 專案
- 專案
- 專案
- 專案
- 專案