KittenML/KittenTTS

State-of-the-art TTS model under 25MB 😻

解決的問題

Kitten TTS 提供了一個輕量級、開源的文字轉語音 (TTS) 函式庫,讓高品質的語音合成能在 CPU 上高效執行,而無需 GPU。它滿足了邊緣部署和本地環境中對於快速、低資源佔用音訊生成的需求。

運作方式

該函式庫建構於 ONNX runtime 之上,提供了多種模型變體(參數量從 15M 到 80M 不等),以平衡效能與大小。它包含內建的文字預處理管線,能處理數字、貨幣和單位,並以 24 kHz 的取樣率輸出音訊。使用者可以從八種內建語音中進行選擇,並透過簡單的 API 調整語音速度。

適用對象

希望將語音合成整合到應用程式中的開發者,且這些應用程式必須在有限的硬體、邊緣裝置或無法使用 GPU 加速的系統上執行。

亮點

  • 超輕量級:模型在磁碟上的大小範圍為 25 MB 至 80 MB。
  • CPU 最佳化:使用 ONNX 進行高效推論,無需 GPU。
  • 內建語音:包含 8 種不同的語音(例如 Bella、Jasper、Luna)。
  • 文字正規化:整合的管線用於展開縮寫、日期和貨幣。
  • 靈活部署:同時支援 CPU 和 CUDA 後端。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案