fishaudio/fish-speech
SOTA Open Source TTS
解决的问题
Fish Speech 是一个专为生成高度自然、情感丰富且逼真的语音而设计的多语言文本转语音(TTS)系统。它解决了在保持高音频保真度和跨数十种语言的快速推理速度的同时,捕捉细微语调和情感的语音生成挑战。
工作原理
该系统采用 双自回归(Dual-Autoregressive, Dual-AR) 架构。大型“慢速 AR”(40亿参数)沿时间轴预测主要语义码本,而小型“快速 AR”(4亿参数)生成残差码本以重建声学细节。模型在 80 多种语言的超过 1000 万小时音频数据上进行训练,并使用 组相对策略优化(GRPO) 强化学习进行对齐,以确保人类般的声学偏好和音色相似性。
适用人群
适用于需要最先进的语音克隆、多说话人对话生成以及对合成语音进行精确情感控制的开发者和创作者。
主要亮点
- 细粒度内联控制:支持超过 15,000 个独特的自然语言标签(例如
[whisper]、[excited]),可直接将情感和语调嵌入文本中。 - 快速语音克隆:仅需 10–30 秒的短参考样本即可完成语音克隆,无需额外微调。
- 多语言支持:无需音素或语言特定预处理,原生支持 80 多种语言。
- 原生多说话人生成:仅需单个参考音频文件中的说话人 ID 令牌,即可在一次生成中处理多个说话人。
- 高性能:通过 SGLang 优化流式传输,实现极低的首音频延迟(~100ms)和 NVIDIA H200 GPU 上的高吞吐量。
- 多轮生成:利用前几轮的上下文信息,提升对话的自然度。
相关
- 项目
- 项目
- 项目
- 项目
- 项目