Edge0-AI/Audio8_TTS
SOTA-Class TTS at Compact Scale
解決的問題
Audio8_TTS 是一個緊湊且支援多語言的語音合成(TTS)系統,旨在實現高品質語音生成與零樣本語音克隆。它致力於提供一個強大但輕量的模型,無需為新語者進行額外訓練即可完成語音克隆,同時保持極小的參數量(0.6B 或 0.1B)。
工作原理
該系統採用 DualAR(雙自回歸)架構。包含一個「慢速 AR」Transformer,用於預測每個音訊幀的語意標記;以及一個「快速 AR」Transformer,基於慢速隱藏狀態和先前的碼本預測編碼器碼本。模型內建神經編碼器用於波形解碼,無需額外模型。
在 0.1B 版本中,純注意力的慢速 AR 主幹被替換為 Falcon-H1 混合架構(Mamba 2 SSM + 注意力),以進一步縮小體積並提升效率。
適用對象
- 尋找輕量、可移植 TTS 模型以整合到應用中的 開發者。
- 對零樣本語音克隆和高效 AR 架構感興趣的 研究人員。
- 需要在多種語言(包括英語、中文、日語、韓語及多種歐洲語言)中實現高品質語音合成的 uma l 使用者。
主要亮點
- 零樣本語音克隆:僅需一段短參考音訊和其轉錄文本即可克隆語音。
- 緊湊體積:提供 0.6B 和 0.1B 參數版本,具有極高效率。
- 多語言支援:針對 11 種語言優化,包括粵語、中文、英語、法語、德語、義大利語、日語、韓語、波蘭語和西班牙語。
- 高性能量:在 Seed-TTS 和 CV3 等基準測試中,性能可與更大規模的 SOTA 模型相媲美。
- 部署選項:支援 CPU ONNX Runtime(INT4)低記憶體部署,以及 SGLang Omni 服務的高吞吐、OpenAI 兼容 API 服務。
相關
- 專案
- 專案
- 專案
- 專案