OpenMOSS/MOSS-TTS-Nano

MOSS-TTS-Nano is an open-source multilingual tiny speech generation model from MOSI.AI and the OpenMOSS team. With only 0.1B parameters, it is designed for realtime speech generation, can run directly on CPU without a GPU, and keeps the deployment stack simple enough for local demos, web serving, and lightweight product integration.

解决的问题

MOSS-TTS-Nano 旨在使高质量、多语言语音生成适用于实时应用。它解决了通常资源消耗巨大的文本转语音(TTS)系统部署难题,提供了一个体积小巧、延迟低的模型,可在无需 GPU 的标准 CPU 上高效运行。

工作原理

该项目采用纯自回归流水线,包括音频分词器和大语言模型(LLM)。具体而言,它使用 MOSS-Audio-Tokenizer-Nano——一种基于因果 Transformer 块的轻量级、无 CNN 分词器——将 48 kHz 立体声音频压缩为令牌流。LLM 随后生成这些令牌以生成语音。在部署方面,它提供 ONNX CPU 版本,移除了 PyTorch 依赖,显著提高了处理效率,使其可在单个 CPU 核心上运行。

适用人群

  • 希望将轻量级 TTS 集成到本地演示、Web 服务或移动应用(包括 Android)中的 开发者
  • 需要以最低基础设施成本实现实时多语言语音生成的 产品团队
  • 对小型高效自回归音频模型感兴趣的 研究人员

主要亮点

  • 极小模型尺寸:仅 0.1B 参数。
  • CPU 友好:可在 4 核 CPU 上实现流式生成,并通过 ONNX 在单核上实现流畅推理。
  • 多语言支持:支持 20 种语言,包括中文、英文、德语、西班牙语和法语。
  • 高保真度:原生 48 kHz、2 通道(立体声)音频输出。
  • 语音克隆:支持使用参考音频提示进行语音克隆。
  • 灵活部署:提供打包的 CLI、FastAPI Web 演示和 ONNX 运行时支持。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目