Aratako/Irodori-TTS
A Flow Matching-based Text-to-Speech Model with Emoji-driven Style Control
What it solves
Irodori-TTS 是一個高保真文字轉語音(TTS)系統,旨在從文字產生自然的音訊。它解決了建立彈性語音身份的挑戰,允許透過短暫的參考音訊片段進行零樣本語音克隆,或透過文字說明(VoiceDesign)進行詳細的風格控制,並且能自動根據輸入文字估算產生音訊的長度。
How it works
系統使用基於 Flow Matching 的架構(Rectified Flow Diffusion Transformer),在由 DACVAE 編解碼器提供的連續潛在空間上運作。它包含多個專門的編碼器:
- Text Encoder:使用預訓練大型語言模型的 token 嵌入與 transformer 層。
- Reference Latent Encoder:處理參考音訊,以使模型條件化於特定說話者的身份。
- Caption Encoder:處理情緒、語調與風格的文字描述,以控制聲音的表現。
- Duration Predictor:v3 版內建的元件,會自動估算輸出音訊的長度。
Who it’s for
- AI Audio Developers:想要實作具高品質且具進階條件(克隆與風格控制)功能的 TTS。
- Content Creators:需要特定情感或風格的聲音,卻不想自行錄製新音訊的使用者。
- ML Researchers:對於在音訊生成上使用 Flow Matching 與 Diffusion Transformers 有興趣的開發者。
Highlights
- Multi-modal Voice Design:結合文字、參考語音與說明文字,精確控制聲音身份與情感。
- Zero-shot Voice Cloning:僅憑一段參考音訊即可克隆聲音。
- Emoji-based Style Control:支援在輸入文字中使用表情符號,以影響非語言的聲音表現。
- PEFT LoRA Fine-Tuning:支援參數高效的特定聲音或風格微調。
- Speaker Inversion:允許學習並儲存可重複使用的說話者嵌入代幣,免除每次呼叫都需提供參考音訊。
- Automatic Watermarking:整合 SilentCipher 以自動為音訊加上水印。