Aratako/Irodori-TTS

A Flow Matching-based Text-to-Speech Model with Emoji-driven Style Control

What it solves

Irodori-TTS 是一个高保真文字转语音(TTS)系统,旨在从文字生成自然的音频。它解决了创建灵活语音身份的挑战,允许通过短暂的参考音频片段进行零样本语音克隆,或通过文字说明(VoiceDesign)进行详细的风格控制,并且能够自动根据输入文字估算生成音频的长度。

How it works

系统使用基于 Flow Matching 的架构(Rectified Flow Diffusion Transformer),在由 DACVAE 编解码器提供的连续潜在空间上运行。它包含多个专门的编码器:

  • Text Encoder:使用预训练大型语言模型的 token 嵌入和 transformer 层。
  • Reference Latent Encoder:处理参考音频,以使模型条件化于特定说话者的身份。
  • Caption Encoder:处理情绪、语调和风格的文字描述,以控制声音的表现。
  • Duration Predictor:v3 版内置的组件,自动估算输出音频的长度。

Who it’s for

  • AI Audio Developers:希望实现高质量且具高级条件(克隆和风格控制)功能的 TTS 开发者。
  • Content Creators:需要特定情感或风格的声音,却不想自行录制新音频的用户。
  • ML Researchers:对在音频生成中使用 Flow Matching 与 Diffusion Transformers 感兴趣的研究者。

Highlights

  • Multi-modal Voice Design:结合文字、参考语音和说明文字,精确控制声音身份与情感。
  • Zero-shot Voice Cloning:仅凭一段参考音频即可克隆声音。
  • Emoji-based Style Control:支持在输入文字中使用表情符号,以影响非语言的声音表达。
  • PEFT LoRA Fine-Tuning:支持参数高效的特定声音或风格微调。
  • Speaker Inversion:允许学习并保存可重复使用的说话者嵌入代币,避免每次调用都需提供参考音频。
  • Automatic Watermarking:集成 SilentCipher 实现自动音频水印。