FireRedTeam/FireRedTTS3

FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing

解决的问题

FireRedTTS3 是一个统一的语音生成与编辑系统,旨在处理多种语言和方言的高保真语音克隆,并通过自然语言指令实现复杂的语音修改。

工作原理

该系统基于语义丰富的连续语音表示,提供两种专业变体:

  • FireRedTTS3-Base:专注于零样本语音克隆,仅需一段短参考音频即可模仿说话人的声音。
  • FireRedTTS3-Instruct:指令驱动模型,支持“语音设计”(根据文本描述生成新声音)和“语音编辑”(对现有音频进行语义或声学层面的修改)。

为确保高质量输出,系统采用文本归一化前端,可由本地工具或大语言模型驱动,将多语言书面文本转换为口语形式。

适用人群

本项目适用于从事文本转语音(TTS)、语音克隆和音频编辑的开发者与研究人员,需要一个能处理 24 种语言和 21 种汉语方言的多语言系统。

主要亮点

  • 广泛的语言支持:支持 24 种语言和 21 种汉语方言的零样本克隆。
  • 指令控制的语音设计:无需参考音频,仅凭对年龄、性别、音色、情绪等的文本描述即可生成全新声音。
  • 自由形式的语音编辑:通过文本指令支持语义编辑(插入、删除或替换词语)和声学编辑(调整语速、音高和音量)。
  • 高性能表现:在 Seed-TTS-eval 和 MiniMax-MLS-Test 等基准测试中,词错误率(WER)和说话人相似度均达到最先进水平。

相关

  • 项目
  • 项目
  • 项目
  • 项目