resemble-ai/chatterbox
SoTA open-source TTS
解決的問題
Chatterbox 提供一系列開源文字轉語音(TTS)模型,旨在從文字生成自然、對話式的音訊。它解決了在不同硬體限制下(從高性能 GPU 到資源受限的 CPU)實現高品質語音克隆與多語言語音生成的需求。
工作原理
本專案提供多種針對不同使用情境的模型變體:
- Chatterbox-Turbo:一個 3.5 億參數的模型,專為低延遲語音代理優化,採用蒸餾解碼器,將生成步驟從 10 步減少至 1 步。
- Chatterbox-Nano:基於 Turbo 架構的 1.1 億參數版本,專為裝置端與 CPU 推論設計,可在 8 個 CPU 核心上實現比即時快 3 倍的運行速度。
- Chatterbox-Multilingual V3:一個 5 億參數的通用模型,支援超過 23 種語言,具備更佳的說話人相似度與更低的幻覺現象。
- 單語言套件:針對優先語言(如中文、印地語、西班牙語)的專用微調版本,提供更嚴格的品質控制與區域方言準確性。
所有模型均支援透過參考音訊片段實現零樣本語音克隆,並透過 Perth 系統內建不可見神經水印,以實現負責任的 AI 使用。
適用對象
- 語音代理開發者:需要低延遲、高保真語音用於互動式應用的開發者。
- 本地化專家:需要在多種語言間實現穩定語音克隆的使用者。
- 邊緣裝置開發者:需要在 CPU 或記憶體與 VRAM 預算緊張的裝置上部署 TTS 的開發者。
- 內容創作者:希望使用 [laugh] 或 [cough] 等副語言標籤為旁白增添真實感的個人。
主要亮點
- 多樣化的模型庫:從 1.1 億到 5 億參數,可靈活平衡速度與品質。
- 原生副語言支援:可插入笑聲、輕笑等非語言提示,增強語音表現力。
- 廣泛的多語言支援:支援 23+ 種語言,並提供專用單語言微調以提升精確度。
- CPU 優化:Nano 模型支援高效裝置端推論。
- 負責任的 AI:整合神經水印技術,用於檢測生成音訊。
相關
- 專案
- 專案
- 專案
- 專案
- 專案