FireRedTeam/FireRedTTS3

FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing

解決的問題

FireRedTTS3 是一個統一的語音生成與編輯系統,旨在處理多種語言與方言的高保真語音克隆,並透過自然語言指令實現複雜的語音修改。

工作原理

該系統基於語義豐富的連續語音表示,提供兩種專業變體:

  • FireRedTTS3-Base:專注於零樣本語音克隆,僅需一段短參考音訊即可模仿說話人的聲音。
  • FireRedTTS3-Instruct:指令驅動模型,支援「語音設計」(根據文字描述生成新聲音)與「語音編輯」(對現有音訊進行語義或聲學層面的修改)。

為確保高品質輸出,系統採用文字歸一化前端,可由本地工具或大語言模型驅動,將多語言書面文字轉換為口語形式。

適用對象

本專案適用於從事文字轉語音(TTS)、語音克隆與音訊編輯的開發者與研究人員,需要一個能處理 24 種語言和 21 種漢語方言的多語言系統。

主要亮點

  • 廣泛的語言支援:支援 24 種語言與 21 種漢語方言的零樣本克隆。
  • 指令控制的語音設計:無需參考音訊,僅憑對年齡、性別、音色、情緒等的文本描述即可生成全新聲音。
  • 自由形式的語音編輯:透過文字指令支援語義編輯(插入、刪除或替換詞語)與聲學編輯(調整語速、音高與音量)。
  • 高性能量表現:在 Seed-TTS-eval 與 MiniMax-MLS-Test 等基準測試中,詞錯誤率(WER)與說話人相似度均達最先進水準。

相關

  • 專案
  • 專案
  • 專案
  • 專案