resemble-ai/chatterbox

SoTA open-source TTS

解决的问题

Chatterbox 提供一系列开源文本转语音(TTS)模型,旨在从文本生成自然、对话式的音频。它解决了在不同硬件约束下(从高性能 GPU 到资源受限的 CPU)实现高质量语音克隆和多语言语音生成的需求。

工作原理

该项目提供多种针对不同使用场景的模型变体:

  • Chatterbox-Turbo:一个 3.5 亿参数的模型,专为低延迟语音代理优化,采用蒸馏解码器,将生成步骤从 10 步减少到 1 步。
  • Chatterbox-Nano:基于 Turbo 架构的 1.1 亿参数版本,专为设备端和 CPU 推理设计,可在 8 个 CPU 核心上实现比实时快 3 倍的运行速度。
  • Chatterbox-Multilingual V3:一个 5 亿参数的通用模型,支持超过 23 种语言,具备更优的说话人相似度和更低的幻觉现象。
  • 单语言包:针对优先语言(如中文、印地语、西班牙语)的专用微调版本,提供更严格的品质控制和区域方言准确性。

所有模型均支持通过参考音频片段实现零样本语音克隆,并通过 Perth 系统内置不可见神经水印,以实现负责任的 AI 使用。

适用人群

  • 语音代理开发者:需要低延迟、高保真语音用于交互式应用的开发者。
  • 本地化专家:需要在多种语言间实现稳定语音克隆的用户。
  • 边缘设备开发者:需要在 CPU 或内存与显存预算紧张的设备上部署 TTS 的开发者。
  • 内容创作者:希望使用 [laugh] 或 [cough] 等副语言标签为旁白增添真实感的个人。

主要亮点

  • 多样化的模型库:从 1.1 亿到 5 亿参数,可灵活平衡速度与质量。
  • 原生副语言支持:可插入笑声、轻笑等非语言提示,增强语音表现力。
  • 广泛的多语言支持:支持 23+ 种语言,并提供专用单语言微调以提升精度。
  • CPU 优化:Nano 模型支持高效设备端推理。
  • 负责任的 AI:集成神经水印技术,用于检测生成音频。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目