MisoLabsAI/MisoTTS

Miso TTS is an 8 billion, highly emotive text-to-speech model

解決的問題

Miso TTS 8B 專為高品質的對話式英語語音生成而設計。它允許使用者將文本轉換為聽起來自然的對話,並能夠透過參考先前的音訊進行聲音克隆。

工作原理

該模型採用了受 Sesame CSM 架構啟發的 RVQ Transformer 架構。它由兩個主要組件組成:

  • 一個大型 Llama 3.2 風格的骨幹網路(8B 參數),用於處理文本與音訊幀嵌入。
  • 一個較小的自回歸音訊解碼器(300M 參數),用於預測每一幀中的高階音訊碼本。

它利用 Mimi 音訊分詞器,並從文本與選用的音訊上下文生成音訊碼,使其能夠保持對話歷史,從而實現更自然的語音。

適用對象

需要能夠進行對話式對話與聲音克隆的高保真文本轉語音系統,並且可以使用高顯存 GPU(例如,bfloat16 精度需要 24GB+ VRAM)的開發人員與研究人員。

亮點

  • 專注於對話:專門為對話生成而非簡單的朗讀而設計。
  • 聲音克隆:支援透過以現有音訊樣本為條件進行提示生成。
  • 浮水印:包含用於安全性與真實性的預設浮水印。
  • 基於 Llama 的架構:利用大規模 Transformer 骨幹網路實現高品質輸出。

相關

  • 專案
  • 專案
  • 專案
  • 專案