Audio8-AI/Audio8_TTS
SOTA-Class TTS at Compact Scale
解决的问题
Audio8_TTS 是一个紧凑的多语言文本到语音(TTS)系统,旨在实现高质量语音生成和零样本语音克隆。它解决了对高效、小参数模型的需求,能够在无需为特定语音进行额外训练的情况下,仅通过一段简短的参考音频片段即可模仿说话者的语音。
工作原理
该系统采用 DualAR(双自回归)架构。一个“慢速”AR 变压器预测音频帧的语义标记,随后由一个“快速”AR 变压器预测编码器码本。该模型自带神经编码器用于波形解码,无需依赖外部模型。提供两种主要版本:0.6B 参数的预览模型,以及利用 Falcon-H1 混合骨干(Mamba 2 SSM + 注意力)的高可移植性 0.1B 参数版本。
适用人群
寻找轻量级、多语言 TTS 解决方案,支持零样本语音克隆,并可在各种硬件上部署(包括通过 ONNX Runtime 在 CPU 上部署,或使用 SGLang Omni 服务在高性能 GPU 服务器上部署)的开发者和研究人员。
主要亮点
- 零样本语音克隆:仅通过参考音频片段及其转录文本即可模仿声音。
- 多语言支持:针对 11 种语言优化,包括英语、中文、日语、韩语、西班牙语、法语、德语、意大利语、荷兰语和波兰语。
- 高效部署:支持通过 ONNX INT4 在 CPU 上部署,以及使用 SGLang Omni 实现高吞吐量服务(包括分页注意力和动态批处理)。
- 紧凑体积:尽管参数量显著更少(0.6B 对比 1.5B–8.5B),但在多个基准测试(如 Seed-TTS)中表现优于更大的 SOTA 模型。
- SFT 流水线:包含独立的监督微调流水线,可用于进一步适应。
相关
- 项目
- 项目
- 项目
- 项目
- 项目