fishaudio/fish-diffusion

An easy to understand TTS / SVS / SVC framework

解決的問題

Fish Diffusion 是一個旨在簡化高品質語音生成模型建立的訓練框架。它透過提供解耦、易於理解的程式碼結構,解決了語音合成(TTS)、歌唱語音合成(SVS)與歌唱語音轉換(SVC)模型訓練的複雜性。

工作原理

本專案利用擴散模型處理各種語音生成任務。它與 FishAudio NSF-HiFiGAN 等聲碼器整合,並支援提取音高、文字與梅爾特徵等音訊特徵,以訓練能生成或轉換語音的模型。

適用對象

適合從事語音合成與轉換的開發者與研究人員,特別是尋找支援多說話人訓練與高效硬體利用之框架的使用者。

主要亮點

  • 多說話人支援:可訓練處理多種不同聲音的模型。
  • 高效訓練:支援半精度訓練與多機器、多裝置設定,以減少記憶體使用並提升速度。
  • 模組化設計:採用解耦的程式碼結構,比先前的 diffsvc 更易理解。
  • 廣泛相容性:支援 44.1kHz Diff Singer 社群聲碼器,並提供工具將現有的 DiffSVC 模型進行轉換。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案