jasonppy/VoiceCraft
Zero-Shot Speech Editing and Text-to-Speech in the Wild
解決的問題
VoiceCraft 解決了使用『野生』資料(例如播客、有聲書和網路影片)進行高品質零樣本語音編輯與文字轉語音(TTS)的困難。它僅需幾秒的參考音訊即可克隆未見過的聲音,使其既能從文字生成新語音,也能修改現有的音訊錄音。
工作原理
VoiceCraft 是一種 token infilling 神經編碼語言模型。它將語音視為一連串 token(使用 Encodec),並採用語言模型方法,根據文字轉錄與參考音訊提示來『填補』語音 token 的缺失部分。這種架構使其能同時處理 TTS(從零生成語音)與語音編輯(替換或修改現有音訊片段的特定部分)。
適用對象
- 音訊工程師與內容創作者:無需原始講者重新錄製即可編輯語音音訊。
- AI 研究人員:對神經編碼語言模型與零樣本語音克隆感興趣者。
- 開發者:希望透過獨立腳本或 Docker 將高品質 TTS 與語音編輯整合至應用程式的使用者。
主要亮點
- 零樣本語音克隆:僅需幾秒參考音訊即可克隆未見過的聲音。
- 雙重功能:同時支援文字轉語音生成與語音編輯。
- 真實場景表現:在包含有聲書與播客的多樣化真實語音資料上訓練而成。
- 彈性部署:提供多種推理執行方式,包括 Google Colab、Docker 與獨立 Python 腳本。
相關
- 專案
- 專案
- 專案
- 專案
- 專案