resemble-ai/chatterbox

SoTA open-source TTS

解決的問題

Chatterbox 提供一系列開源文字轉語音(TTS)模型,旨在從文字生成自然、對話式的音訊。它解決了在不同硬體限制下(從高性能 GPU 到資源受限的 CPU)實現高品質語音克隆與多語言語音生成的需求。

工作原理

本專案提供多種針對不同使用情境的模型變體:

  • Chatterbox-Turbo:一個 3.5 億參數的模型,專為低延遲語音代理優化,採用蒸餾解碼器,將生成步驟從 10 步減少至 1 步。
  • Chatterbox-Nano:基於 Turbo 架構的 1.1 億參數版本,專為裝置端與 CPU 推論設計,可在 8 個 CPU 核心上實現比即時快 3 倍的運行速度。
  • Chatterbox-Multilingual V3:一個 5 億參數的通用模型,支援超過 23 種語言,具備更佳的說話人相似度與更低的幻覺現象。
  • 單語言套件:針對優先語言(如中文、印地語、西班牙語)的專用微調版本,提供更嚴格的品質控制與區域方言準確性。

所有模型均支援透過參考音訊片段實現零樣本語音克隆,並透過 Perth 系統內建不可見神經水印,以實現負責任的 AI 使用。

適用對象

  • 語音代理開發者:需要低延遲、高保真語音用於互動式應用的開發者。
  • 本地化專家:需要在多種語言間實現穩定語音克隆的使用者。
  • 邊緣裝置開發者:需要在 CPU 或記憶體與 VRAM 預算緊張的裝置上部署 TTS 的開發者。
  • 內容創作者:希望使用 [laugh] 或 [cough] 等副語言標籤為旁白增添真實感的個人。

主要亮點

  • 多樣化的模型庫:從 1.1 億到 5 億參數,可靈活平衡速度與品質。
  • 原生副語言支援:可插入笑聲、輕笑等非語言提示,增強語音表現力。
  • 廣泛的多語言支援:支援 23+ 種語言,並提供專用單語言微調以提升精確度。
  • CPU 優化:Nano 模型支援高效裝置端推論。
  • 負責任的 AI:整合神經水印技術,用於檢測生成音訊。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案