index-tts/index-tts

An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System

解决的问题

IndexTTS 是一个零样本文本转语音 (TTS) 系统,旨在仅使用单个参考音频剪辑来克隆特定声音。它解决了在不需要为每个新声音进行大量训练数据的情况下,实现多语言高保真、可控语音合成的需求。

工作原理

该系统使用自回归模型来合成语音。它允许用户提供一个用于音色(声音的独特品质)的参考音频剪辑,并可以有选择地提供单独的情感参考音频或情感向量来控制语音的情绪。最新版本 IndexTTS-2.5 支持中文、英文、日语、西班牙语和阿拉伯语,并通过音素(拼音、CMU 和日语假名)实现了对说话速度和发音的精细控制。

适用对象

该工具面向寻找支持多语言克隆、精确情感表达和生产级部署(通过 vLLM 支持)的工业级 TTS 系统的开发人员和研究人员。

亮点

  • Zero-Shot Cloning: 从单个音频样本克隆声音。
  • 多语言支持: 支持中文、英文、日语、西班牙语和阿拉伯语。
  • 精细控制: 提供对情感强度、说话速度 (0.5x 至 2.0x) 以及使用音素进行特定发音的控制。
  • 灵活的情感输入: 可以通过参考音频、预定义的情感向量或从文本本身自动推导来控制情感。
  • 生产就绪: 与 vLLM 兼容,实现高效服务。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目