OpenMOSS/MOSS-TTS
MOSS‑TTS Family is an open‑source speech and sound generation model family from MOSI.AI and the OpenMOSS team. It is designed for high‑fidelity, high‑expressiveness, and complex real‑world scenarios, covering stable long‑form speech, multi‑speaker dialogue, voice/character design, environmental sound effects, and real‑time streaming TTS.
解決的問題
MOSS-TTS Family 提供了一套生產級的語音與聲音生成模型,旨在處理複雜的現實世界音訊需求。它解決了單一 TTS 模型無法同時提供高保真長文本語音、表現力豐富的多發言人對話、基於文本的零樣本語音設計、低延遲即時互動以及環境音效的局限性。
工作原理
該專案根據不同的架構將音訊生成工作流分解為五個專業模型:
MOSS-TTS: 用於高保真、長文本語音與零樣本語音複製的旗艦模型,具有精細的發音與時長控制。
MOSS-TTSD: 專門用於表現力豐富的多發言人超長對話的模型。
MOSS-VoiceGenerator: 一種語音設計模型,可以透過文本提示建立多樣化的聲音與風格,無需參考音訊。
MOSS-TTS-Realtime: 用於語音代理的低延遲模型,使用增量合成與上下文感知來保持對話回合間的一致性。
MOSS-SoundEffect: 用於從文本生成環境音與生物音效的模型。
它利用了互補的架構,如 MossTTSDelay(用於穩定性與速度)和 MossTTSLocal(用於輕量級串流),並透過 MOSS-Audio-Tokenizer-v2 支援 48 kHz 立體聲輸出。
適用對象
這適用於構建語音代理的開發人員、製作電影或遊戲的內容創作者,以及從事語音合成與音訊生成研究的研究人員。
亮點
- 全面的音訊套件:涵蓋從語音合成、對話到語音設計與音訊效果的所有內容。
- 多語言支援:支援 31 種語言,包括語碼轉換能力。
- 高保真度:原生 48 kHz 立體聲輸入與輸出。
- 靈活部署:支援透過 llama.cpp 與 ONNX Runtime 進行無需 PyTorch 的推理,以及 SGLang-Omni 與 vLLM-Omni 等加速後端。
- 即時性能:MOSS-TTS-Realtime 的首字元時間 (TTFB) 達到 180 ms。
相關
- 專案
- 專案
- 專案
- 專案
- 專案