fishaudio/fish-speech

SOTA Open Source TTS

解決的問題

Fish Speech 是一個專為生成高度自然、情感豐富且逼真的語音而設計的多語言文字轉語音(TTS)系統。它解決了在保持高音質與跨數十種語言的快速推論速度的同時,捕捉細微語調與情感的語音生成挑戰。

工作原理

該系統採用 雙自回歸(Dual-Autoregressive, Dual-AR) 架構。大型「慢速 AR」(40 億參數)沿時間軸預測主要語意碼本,而小型「快速 AR」(4 億參數)生成殘差碼本以重建聲學細節。模型在 80 多種語言的超過 1,000 萬小時音訊資料上訓練,並使用 群組相對策略優化(GRPO) 強化學習進行對齊,以確保人類般的聲學偏好與音色相似性。

適用對象

適用於需要最尖端語音克隆、多說話人對話生成,以及對合成語音進行精確情感控制的開發者與創作者。

主要亮點

  • 細粒度內嵌控制:支援超過 15,000 個獨特的自然語言標籤(例如 [whisper][excited]),可直接將情感與語調嵌入文字中。
  • 快速語音克隆:僅需 10–30 秒的短參考樣本即可完成語音克隆,無需額外微調。
  • 多語言支援:無需音素或語言特定預處理,原生支援 80 多種語言。
  • 原生多說話人生成:僅需單一參考音訊檔案中的說話人 ID 標籤,即可在一次生成中處理多個說話人。
  • 高效率:透過 SGLang 優化串流傳輸,實現極低的首音頻延遲(~100ms)與 NVIDIA H200 GPU 上的高吞吐量。
  • 多輪生成:利用前幾輪的上下文資訊,提升對話的自然度。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案