Audio8-AI/Audio8_TTS

SOTA-Class TTS at Compact Scale

解決的問題

Audio8_TTS 是一個緊湊的多語言語音合成(TTS)系統,旨在實現高品質語音生成與零樣本語音克隆。它解決了對高效、小參數模型的需求,能在不需為特定語音進行額外訓練的情況下,僅透過一段短暫的參考音訊片段即可模擬說話者的語音。

工作原理

該系統採用 DualAR(雙自回歸)架構。一個「慢速」AR 變壓器預測音訊幀的語意標記,隨後由一個「快速」AR 變壓器預測編碼器碼本。該模型內建神經編碼器用於波形解碼,無需依賴外部模型。提供兩種主要版本:0.6B 參數的預覽模型,以及利用 Falcon-H1 混合骨幹(Mamba 2 SSM + 注意力)的高可移植性 0.1B 參數版本。

適用對象

尋找輕量級、多語言 TTS 解決方案,支援零樣本語音克隆,並可在各種硬體上部署(包括透過 ONNX Runtime 在 CPU 上部署,或使用 SGLang Omni 服務在高性能 GPU 伺服器上部署)的開發者與研究人員。

主要亮點

  • 零樣本語音克隆:僅透過參考音訊片段及其轉錄文本即可模擬聲音。
  • 多語言支援:針對 11 種語言優化,包括英語、中文、日語、韓語、西班牙語、法語、德語、義大利語、荷蘭語與波蘭語。
  • 高效部署:支援透過 ONNX INT4 在 CPU 上部署,以及使用 SGLang Omni 實現高吞吐量服務(包含分頁注意力與動態批次)。
  • 緊湊體積:儘管參數量顯著更少(0.6B 對比 1.5B–8.5B),但在多個基準測試(如 Seed-TTS)中表現優於更大的 SOTA 模型。
  • SFT 流水線:包含獨立的監督微調流水線,可用於進一步適應。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案