samuel-vitorino/sopro

A lightweight text-to-speech model with zero-shot voice cloning

解决的问题

Sopro TTS 旨在提供高保真、可理解的文本转语音(TTS)和语音克隆,且占用空间极小。它解决了在消费级硬件(如笔记本电脑 CPU 或直接在浏览器中)上运行高效、低延迟音频生成的需求,而无需依赖庞大的 GPU 资源。

工作原理

Sopro 使用一个轻量级的 120M 参数模型(sopro-v2-turbo),支持从短参考音频片段(5-20 秒)进行零样本语音克隆。它可在两种模式下运行:一种是用于最高音质的离线路径,另一种是用于最小延迟的流式路径,在笔记本电脑 CPU 上可实现约 300ms 的首音频输出时间。该模型支持英语、欧洲葡萄牙语、法语和德语。

适用人群

该项目适用于需要快速、设备端 TTS 和语音克隆的开发者,以及希望通过 ONNX 运行时将语音合成集成到浏览器环境中的开发者。

主要亮点

  • 体积小巧:120M 参数,可在笔记本电脑 CPU 和浏览器中运行。
  • 零样本克隆:仅需 5-20 秒参考音频即可克隆语音。
  • 多语言支持:支持英语、欧洲葡萄牙语、法语和德语。
  • 高效能:在 M3 CPU 和 H100 GPU 上实现低实时因子(RTF)。
  • 流式能力:支持流式音频生成,适用于实时交互。
  • 因果声码器:为流式路径内置因果声码器。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目