jasonppy/VoiceCraft

Zero-Shot Speech Editing and Text-to-Speech in the Wild

解决的问题

VoiceCraft 解决了使用‘野生’数据(如播客、有声书和网络视频)进行高质量零样本语音编辑和文本转语音(TTS)的困难。它仅需几秒的参考音频即可克隆未见过的声音,使其既能从文本生成新语音,也能修改现有音频录音。

工作原理

VoiceCraft 是一种 token infilling 神经编码语言模型。它将语音视为一系列 token(使用 Encodec),并采用语言模型方法,基于文本转录和参考音频提示来‘填充’音频 token 的缺失部分。这种架构使其能够同时处理 TTS(从零生成语音)和语音编辑(替换或修改现有音频片段的特定部分)。

适用人群

  • 音频工程师和内容创作者:无需原始说话人重新录制即可编辑语音音频。
  • AI 研究人员:对神经编码语言模型和零样本语音克隆感兴趣的人员。
  • 开发者:希望使用独立脚本或 Docker 将高质量 TTS 和语音编辑集成到应用程序中的用户。

主要亮点

  • 零样本语音克隆:仅需几秒参考音频即可克隆未见过的声音。
  • 双重功能:同时支持文本转语音生成和语音编辑。
  • 真实场景表现:在包括有声书和播客在内的多样化真实音频数据上进行训练。
  • 灵活部署:提供多种推理运行方式,包括 Google Colab、Docker 和独立 Python 脚本。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目