tronghieuit/v-tts
The lightest Vietnamese Text-to-Speech with Multi-Speaker TTS and Zero-Shot Voice Cloning.
解決的問題
V-TTS 為越南語文本轉語音 (TTS) 提供了一種輕量且高效的解決方案,專門解決無需 GPU 即可在標準消費級硬體上執行的高品質語音合成與語音克隆需求。
工作原理
該系統使用由合成器、用於身份提取的說話人編碼器、用於韻律與情感的風格編碼器以及用於音高與能量的韻律預測器組成的神經架構。對於零樣本克隆,它從 3-10 秒的參考音訊剪輯中提取嵌入,以生成該特定聲音的語音。它包含一個專用的越南語音素轉換器,以支援北部與南部方言。
適用對象
- 需要無需專業錄音設備即可進行越南語配音的內容創作者。
- 希望透過簡單的 Python API 或 ONNX 執行期將越南語 TTS 整合到應用程式中的開發人員。
- 希望透過獨立的
.exe應用程式獲得即插即用體驗的 Windows 用戶。
亮點
- 超輕量級:僅 74.8M 參數,使其可以完全在 CPU 上執行。
- 零樣本克隆:只需 3-10 秒的參考音訊即可克隆任何聲音,無需微調。
- 高性能:在 CPU 上實現比實時快 3-4 倍的推論速度。
- 方言支援:內建對越南語北部與南部語音的支援。
- 靈活部署:提供 Windows 應用程式、Docker 容器、Python 套件以及用於 Web 與 Android 的 ONNX 匯出。
相關
- 專案
- 專案
- 專案
- 專案
- 專案