breezeblue-ai/breeze-tts
Official PyTorch inference for Breeze TTS 2
解决的问题
Breeze TTS 2 专为实时、富有表现力的文本转语音(TTS)交互而设计。它满足了通过自然语言指令精确控制的高质量、低延迟音频生成的需求,使用户无需大量技术设置或多个参考样本即可创建或修改语音。
工作原理
该模型是一个双语(英语和中文)开放权重系统,支持三种主要操作模式:
- 语音克隆:使用参考音频片段及其转录文本来复制说话者的音色和风格。
- 语音设计:仅基于自然语言描述(例如,“一个温暖、体贴的年轻女性”)生成全新的语音。
- 语音导向:将参考音频与特定指令相结合,以引导克隆语音的语调、情感和节奏。
它还支持使用括号或方括号直接插入文本中的“发声事件”(如大笑或叹气)。为了实现超低延迟,它利用带有 CUDA 图和专用解码阶段的“快速路径”来最小化首次音频时间(TTFA)。
适用人群
该项目面向构建实时 AI 语音代理、交互式应用程序的开发者和研究人员,以及需要在英语和中文中精确控制语音表达和情感的内容创作者。
亮点
- 指令遵循:支持使用自然语言进行无参考语音设计和有参考语音导向。
- 超低延迟:在 NVIDIA H100 GPU 上实现低于 40 毫秒的首次音频时间(TTFA)。
- 双语支持:单个模型自然处理英语和中文语音。
- 表现力控制:允许插入诸如
(laugh)或(sigh)之类的内联发声事件,以实现更人性化的表达。 - GPU 效率:在 eager 推理时约使用 7.7 GiB 的 GPU 内存。
相关
- 项目
- 项目
- 项目
- 项目