fishaudio/fish-diffusion
An easy to understand TTS / SVS / SVC framework
解决的问题
Fish Diffusion 是一个旨在简化高质量语音生成模型创建的训练框架。它通过提供解耦、易于理解的代码结构,解决了文本转语音(TTS)、歌声合成(SVS)和歌声转换(SVC)模型训练的复杂性。
工作原理
该项目利用扩散模型处理各种语音生成任务。它与 FishAudio NSF-HiFiGAN 等声码器集成,并支持提取音高、文本和梅尔特征等音频特征,以训练能够生成或转换语音的模型。
适用人群
适用于从事语音合成与转换的开发者和研究人员,特别是那些需要支持多说话人训练和高效硬件利用的框架的用户。
主要亮点
- 多说话人支持:能够训练处理多种不同声音的模型。
- 高效训练:支持半精度训练和多机器、多设备设置,以减少内存占用并提升速度。
- 模块化设计:采用解耦的代码结构,比之前的 diffsvc 更易于理解。
- 广泛兼容性:支持 44.1kHz Diff Singer 社区声码器,并提供工具将现有 DiffSVC 模型进行转换。
相关
- 项目
- 项目
- 项目
- 项目
- 项目