Aratako/Irodori-TTS

A Flow Matching-based Text-to-Speech Model with Emoji-driven Style Control

What it solves

Irodori-TTS 是一個高保真文字轉語音(TTS)系統,旨在從文字產生自然的音訊。它解決了建立彈性語音身份的挑戰,允許透過短暫的參考音訊片段進行零樣本語音克隆,或透過文字說明(VoiceDesign)進行詳細的風格控制,並且能自動根據輸入文字估算產生音訊的長度。

How it works

系統使用基於 Flow Matching 的架構(Rectified Flow Diffusion Transformer),在由 DACVAE 編解碼器提供的連續潛在空間上運作。它包含多個專門的編碼器:

  • Text Encoder:使用預訓練大型語言模型的 token 嵌入與 transformer 層。
  • Reference Latent Encoder:處理參考音訊,以使模型條件化於特定說話者的身份。
  • Caption Encoder:處理情緒、語調與風格的文字描述,以控制聲音的表現。
  • Duration Predictor:v3 版內建的元件,會自動估算輸出音訊的長度。

Who it’s for

  • AI Audio Developers:想要實作具高品質且具進階條件(克隆與風格控制)功能的 TTS。
  • Content Creators:需要特定情感或風格的聲音,卻不想自行錄製新音訊的使用者。
  • ML Researchers:對於在音訊生成上使用 Flow Matching 與 Diffusion Transformers 有興趣的開發者。

Highlights

  • Multi-modal Voice Design:結合文字、參考語音與說明文字,精確控制聲音身份與情感。
  • Zero-shot Voice Cloning:僅憑一段參考音訊即可克隆聲音。
  • Emoji-based Style Control:支援在輸入文字中使用表情符號,以影響非語言的聲音表現。
  • PEFT LoRA Fine-Tuning:支援參數高效的特定聲音或風格微調。
  • Speaker Inversion:允許學習並儲存可重複使用的說話者嵌入代幣,免除每次呼叫都需提供參考音訊。
  • Automatic Watermarking:整合 SilentCipher 以自動為音訊加上水印。