Edge0-AI/Audio8_TTS
SOTA-Class TTS at Compact Scale
解决的问题
Audio8_TTS 是一个紧凑且支持多语言的文本到语音(TTS)系统,旨在实现高质量语音生成和零样本语音克隆。它致力于提供一个强大但轻量级的模型,无需为新说话人进行额外训练即可完成语音克隆,同时保持极小的参数量(0.6B 或 0.1B)。
工作原理
该系统采用 DualAR(双自回归)架构。包含一个“慢速 AR”Transformer,用于预测每个音频帧的语义标记;以及一个“快速 AR”Transformer,基于慢速隐藏状态和先前的代码本预测编码器代码本。模型自带神经编码器用于波形解码,无需额外模型。
在 0.1B 版本中,纯注意力的慢速 AR 主干被替换为 Falcon-H1 混合架构(Mamba 2 SSM + 注意力),以进一步减小体积并提升效率。
适用人群
- 寻找轻量、可移植 TTS 模型以集成到应用中的 开发者。
- 对零样本语音克隆和高效 AR 架构感兴趣的 研究人员。
- 需要在多种语言(包括英语、中文、日语、韩语及多种欧洲语言)中实现高质量语音合成的 uma l 用户。
主要亮点
- 零样本语音克隆:仅需一段短参考音频和其转录文本即可克隆语音。
- 紧凑体积:提供 0.6B 和 0.1B 参数版本,具有极高效率。
- 多语言支持:针对 11 种语言优化,包括粤语、中文、英语、法语、德语、意大利语、日语、韩语、波兰语和西班牙语。
- 高性能:在 Seed-TTS 和 CV3 等基准测试中,性能可与更大规模的 SOTA 模型相媲美。
- 部署选项:支持 CPU ONNX Runtime(INT4)低内存部署,以及 SGLang Omni 服务的高吞吐、OpenAI 兼容 API 服务。
相关
- 项目
- 项目
- 项目
- 项目