inworld-ai/tts

Inworld TTS

解決的問題

此專案提供了建立高品質語音合成(TTS)系統所需的訓練與模型架構基礎設施。開發者可使用自己的音訊資料,對基於 SpeechLM 的模型進行預訓練、微調或對齊,支援從單一 GPU 環境到大型多 GPU 集群的各種設定。

如何運作

系統結合 SpeechLM 架構與 1D 音訊編碼器,將文字轉換為語音。工作流程包含:

  1. 資料準備:將原始音訊與文字稿處理成特定的 JSONL 格式。
  2. 向量化:使用編碼器(相容 xcodec2)將音訊轉換為音訊碼。
  3. SFT 訓練:監督式微調(SFT)教導模型根據文字條件生成音訊碼。
  4. RLHF 對齊:人類反饋的強化學習(RLHF)進一步優化模型,利用獎勵函數(例如詞錯誤率)使輸出更符合人類偏好。
  5. 推論:訓練完成的模型,搭配編碼器與解碼器,可根據文字輸入與音訊提示生成語音。

適用對象

需要可擴展訓練管道(支援分散式訓練 DDP、DeepSpeed、FSDP)與 RLHF 對齊功能的 AI 研究人員與工程師,用來建構客製化語音合成模型。

主要特色

  • 分散式訓練:原生支援 DDP、DeepSpeed 與 FSDP,可跨多個 GPU 擴展。
  • RLHF 整合:內建對齊功能,支援獎勵函數與 vLLM,加速訓練期間的生成效率。
  • 彈性模型設計:支援任意 SpeechLM 模型,並相容 xcodec2 檢查點。
  • 完整流程:提供可直接使用的腳本,包含資料向量化、資料分片合併與模型轉換以供部署。

相關

  • 專案
  • Dispatch
  • 專案
  • 專案
  • 專案