fishaudio/fish-diffusion

An easy to understand TTS / SVS / SVC framework

解决的问题

Fish Diffusion 是一个旨在简化高质量语音生成模型创建的训练框架。它通过提供解耦、易于理解的代码结构,解决了文本转语音(TTS)、歌声合成(SVS)和歌声转换(SVC)模型训练的复杂性。

工作原理

该项目利用扩散模型处理各种语音生成任务。它与 FishAudio NSF-HiFiGAN 等声码器集成,并支持提取音高、文本和梅尔特征等音频特征,以训练能够生成或转换语音的模型。

适用人群

适用于从事语音合成与转换的开发者和研究人员,特别是那些需要支持多说话人训练和高效硬件利用的框架的用户。

主要亮点

  • 多说话人支持:能够训练处理多种不同声音的模型。
  • 高效训练:支持半精度训练和多机器、多设备设置,以减少内存占用并提升速度。
  • 模块化设计:采用解耦的代码结构,比之前的 diffsvc 更易于理解。
  • 广泛兼容性:支持 44.1kHz Diff Singer 社区声码器,并提供工具将现有 DiffSVC 模型进行转换。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目