FireRedTeam/FireRedTTS3
FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing
解決的問題
FireRedTTS3 是一個統一的語音生成與編輯系統,旨在處理多種語言與方言的高保真語音克隆,並透過自然語言指令實現複雜的語音修改。
工作原理
該系統基於語義豐富的連續語音表示,提供兩種專業變體:
- FireRedTTS3-Base:專注於零樣本語音克隆,僅需一段短參考音訊即可模仿說話人的聲音。
- FireRedTTS3-Instruct:指令驅動模型,支援「語音設計」(根據文字描述生成新聲音)與「語音編輯」(對現有音訊進行語義或聲學層面的修改)。
為確保高品質輸出,系統採用文字歸一化前端,可由本地工具或大語言模型驅動,將多語言書面文字轉換為口語形式。
適用對象
本專案適用於從事文字轉語音(TTS)、語音克隆與音訊編輯的開發者與研究人員,需要一個能處理 24 種語言和 21 種漢語方言的多語言系統。
主要亮點
- 廣泛的語言支援:支援 24 種語言與 21 種漢語方言的零樣本克隆。
- 指令控制的語音設計:無需參考音訊,僅憑對年齡、性別、音色、情緒等的文本描述即可生成全新聲音。
- 自由形式的語音編輯:透過文字指令支援語義編輯(插入、刪除或替換詞語)與聲學編輯(調整語速、音高與音量)。
- 高性能量表現:在 Seed-TTS-eval 與 MiniMax-MLS-Test 等基準測試中,詞錯誤率(WER)與說話人相似度均達最先進水準。
相關
- 專案
- 專案
- 專案
- 專案