OpenMOSS/MOSS-TTS

MOSS‑TTS Family is an open‑source speech and sound generation model family from MOSI.AI and the OpenMOSS team. It is designed for high‑fidelity, high‑expressiveness, and complex real‑world scenarios, covering stable long‑form speech, multi‑speaker dialogue, voice/character design, environmental sound effects, and real‑time streaming TTS.

解决的问题

MOSS-TTS Family 提供了一套生产级的语音和声音生成模型,旨在处理复杂的现实世界音频需求。它解决了单个 TTS 模型无法同时提供高保真长文本语音、表现力丰富的多发言人对话、基于文本的零样本语音设计、低延迟实时交互以及环境音效的局限性。

工作原理

该项目根据不同的架构将音频生成工作流分解为五个专业模型:

  • MOSS-TTS: 用于高保真、长文本语音和零样本语音克隆的旗舰模型,具有精细的发音和时长控制。
  • MOSS-TTSD: 专门用于表现力丰富的多发言人超长对话的模型。
  • MOSS-VoiceGenerator: 一种语音设计模型,可以通过文本提示创建多样化的声音和风格,无需参考音频。
  • MOSS-TTS-Realtime: 用于语音代理的低延迟模型,使用增量合成和上下文感知来保持对话回合间的一致性。
  • MOSS-SoundEffect: 用于从文本生成环境音和生物音效的模型。

它利用了互补的架构,如 MossTTSDelay(用于稳定性和速度)和 MossTTSLocal(用于轻量级流式传输),并通过 MOSS-Audio-Tokenizer-v2 支持 48 kHz 立体声输出。

适用对象

这适用于构建语音代理的开发人员、制作电影或游戏的内容创作者,以及从事语音合成和音频生成研究的研究人员。

亮点

  • 全面的音频套件:涵盖从语音合成、对话到语音设计和音频效果的所有内容。
  • 多语言支持:支持 31 种语言,包括语码转换能力。
  • 高保真度:原生 48 kHz 立体声输入和输出。
  • 灵活部署:支持通过 llama.cpp 和 ONNX Runtime 进行无需 PyTorch 的推理,以及 SGLang-Omni 和 vLLM-Omni 等加速后端。
  • 实时性能:MOSS-TTS-Realtime 的首字节时间 (TTFB) 达到 180 ms。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目