Ampixa/sanoTTS

sanoTTS (सानो = 'small' in Nepali): a ~1.4M-param neural TTS that runs on a $3 chip or in the browser. Leads SCOREQ/UTMOS in the sub-15M class.

解決的問題

sanoTTS 提供一組極小的神經文字轉語音(TTS)語音,可在無需雲端連接、專用神經處理單元(NPU)或伺服器的情況下,在低功耗硬體上本地運行。它讓 $3 的 ESP32-S3 微控制器或透過 WebAssembly(WASM)在瀏覽器中直接實現即時語音合成成為可能。

工作原理

該系統採用多階段流水線:espeak-ng 語音化器將文字轉換為音素 ID,持續時間模型預測時間,聲學模型預測生成器潛在變數,解碼器生成最終音訊。根據目標平台,使用不同的解碼器:瀏覽器使用緊湊的時間域解碼器(fp32 WASM),微控制器使用量化後的 int8 iSTFT 解碼器,以確保即時性能。

適用對象

  • 嵌入式開發者:希望在廉價微控制器上建構語音設備的開發者。
  • Web 開發者:希望為其網站添加客戶端、無伺服器 TTS 的開發者。
  • Python 開發者:尋找輕量級、無依賴 TTS 套件的開發者。

特點

  • 超小體積:模型參數範圍從 294k 到 2.3M,最小模型(heart-nano)僅佔 337 KB。
  • 廣泛的語言支援:涵蓋英語、西班牙語、法語、阿拉伯語和尼泊爾語等 16 種語言的 30 個語音。
  • 高效率:在 ESP32-S3 上實現 0.383 的即時因子(RTF),表示語音合成速度比即時快 2.6 倍。
  • 零依賴:Python 套件使用純 numpy 進行推論,瀏覽器版本完全在客戶端運行。
  • 可客製化:提供完整的訓練流程,使用者可建立並蒸餾自己的語音。

相關

  • 專案
  • 專案
  • 專案
  • 專案