fishaudio/fish-speech
SOTA Open Source TTS
解決的問題
Fish Speech 是一個專為生成高度自然、情感豐富且逼真的語音而設計的多語言文字轉語音(TTS)系統。它解決了在保持高音質與跨數十種語言的快速推論速度的同時,捕捉細微語調與情感的語音生成挑戰。
工作原理
該系統採用 雙自回歸(Dual-Autoregressive, Dual-AR) 架構。大型「慢速 AR」(40 億參數)沿時間軸預測主要語意碼本,而小型「快速 AR」(4 億參數)生成殘差碼本以重建聲學細節。模型在 80 多種語言的超過 1,000 萬小時音訊資料上訓練,並使用 群組相對策略優化(GRPO) 強化學習進行對齊,以確保人類般的聲學偏好與音色相似性。
適用對象
適用於需要最尖端語音克隆、多說話人對話生成,以及對合成語音進行精確情感控制的開發者與創作者。
主要亮點
- 細粒度內嵌控制:支援超過 15,000 個獨特的自然語言標籤(例如
[whisper]、[excited]),可直接將情感與語調嵌入文字中。 - 快速語音克隆:僅需 10–30 秒的短參考樣本即可完成語音克隆,無需額外微調。
- 多語言支援:無需音素或語言特定預處理,原生支援 80 多種語言。
- 原生多說話人生成:僅需單一參考音訊檔案中的說話人 ID 標籤,即可在一次生成中處理多個說話人。
- 高效率:透過 SGLang 優化串流傳輸,實現極低的首音頻延遲(~100ms)與 NVIDIA H200 GPU 上的高吞吐量。
- 多輪生成:利用前幾輪的上下文資訊,提升對話的自然度。
相關
- 專案
- 專案
- 專案
- 專案
- 專案