MisoLabsAI/MisoTTS
Miso TTS is an 8 billion, highly emotive text-to-speech model
解决的问题
Miso TTS 8B 专为高质量的对话式英语语音生成而设计。它允许用户将文本转换为听起来自然的对话,并能够通过参考先前的音频来进行声音克隆。
工作原理
该模型采用了受 Sesame CSM 架构启发的 RVQ Transformer 架构。它由两个主要组件组成:
- 一个大型 Llama 3.2 风格的骨干网络(8B 参数),用于处理文本和音频帧嵌入。
- 一个较小的自回归音频解码器(300M 参数),用于预测每一帧中的高阶音频码本。
它利用 Mimi 音频分词器,并从文本和可选的音频上下文生成音频码,使其能够保持对话历史,从而实现更自然的语音。
适用对象
需要能够进行对话式对话和声音克隆的高保真文本转语音系统,并且可以使用高显存 GPU(例如,bfloat16 精度需要 24GB+ VRAM)的开发人员和研究人员。
亮点
- 专注于对话:专门为对话生成而非简单的朗读而设计。
- 声音克隆:支持通过以现有音频样本为条件进行提示生成。
- 水印:包含用于安全性和真实性的默认水印。
- 基于 Llama 的架构:利用大规模 Transformer 骨干网络实现高质量输出。
相关
- 项目
- 项目
- 项目
- 项目