MisoLabsAI/MisoTTS

Miso TTS is an 8 billion, highly emotive text-to-speech model

解决的问题

Miso TTS 8B 专为高质量的对话式英语语音生成而设计。它允许用户将文本转换为听起来自然的对话,并能够通过参考先前的音频来进行声音克隆。

工作原理

该模型采用了受 Sesame CSM 架构启发的 RVQ Transformer 架构。它由两个主要组件组成:

  • 一个大型 Llama 3.2 风格的骨干网络(8B 参数),用于处理文本和音频帧嵌入。
  • 一个较小的自回归音频解码器(300M 参数),用于预测每一帧中的高阶音频码本。

它利用 Mimi 音频分词器,并从文本和可选的音频上下文生成音频码,使其能够保持对话历史,从而实现更自然的语音。

适用对象

需要能够进行对话式对话和声音克隆的高保真文本转语音系统,并且可以使用高显存 GPU(例如,bfloat16 精度需要 24GB+ VRAM)的开发人员和研究人员。

亮点

  • 专注于对话:专门为对话生成而非简单的朗读而设计。
  • 声音克隆:支持通过以现有音频样本为条件进行提示生成。
  • 水印:包含用于安全性和真实性的默认水印。
  • 基于 Llama 的架构:利用大规模 Transformer 骨干网络实现高质量输出。

相关

  • 项目
  • 项目
  • 项目
  • 项目