OpenMOSS/MOSS-TTS-Nano
MOSS-TTS-Nano is an open-source multilingual tiny speech generation model from MOSI.AI and the OpenMOSS team. With only 0.1B parameters, it is designed for realtime speech generation, can run directly on CPU without a GPU, and keeps the deployment stack simple enough for local demos, web serving, and lightweight product integration.
解決的問題
MOSS-TTS-Nano 是為實時應用設計,使高品質、多語言語音生成更易取得。它解決了傳統上資源消耗龐大的文字轉語音(TTS)系統部署難題,提供一個體積微小、延遲低的模型,可在無需 GPU 的標準 CPU 上高效運行。
工作原理
本專案採用純自回歸流程,包含音訊分詞器與大語言模型(LLM)。具體而言,使用 MOSS-Audio-Tokenizer-Nano——一種基於因果 Transformer 模塊的輕量級、無 CNN 分詞器——將 48 kHz 立體音訊壓縮為詞碼串流。LLM 隨後生成這些詞碼以產生語音。在部署方面,提供移除 PyTorch 依賴的 ONNX CPU 版本,大幅提高處理效率,使其可在單一 CPU 核心上執行。
適用對象
- 希望將輕量級 TTS 集成至本地示範、Web 服務或行動應用(含 Android)的 開發者。
- 需要以最低基礎設施成本實現即時多語言語音生成的 產品團隊。
- 對小型高效自回歸音訊模型感興趣的 研究人員。
主要特色
- 極小模型尺寸:僅 0.1B 參數。
- CPU 友好:可在 4 核 CPU 上實現串流生成,並透過 ONNX 在單核上實現順暢推論。
- 多語言支援:支援 20 種語言,包括中文、英文、德文、西班牙文與法文。
- 高保真度:原生 48 kHz、2 通道(立體聲)音訊輸出。
- 語音克隆:支援使用參考音訊提示進行語音克隆。
- 彈性部署:提供打包 CLI、FastAPI Web 示範與 ONNX 執行時支援。
相關
- 專案
- 專案
- 專案
- 專案
- 專案