neuphonic/neutts

On-device TTS model by Neuphonic

解决的问题

NeuTTS 旨在将高质量文本转语音 (TTS) 从基于云端的 API 迁移到本地设备。它提供了一套轻量级、听感自然的语音模型,可以在手机、笔记本电脑和 Raspberry Pi 等嵌入式设备上运行,无需持续的互联网连接,从而确保更好的隐私保护和更低的延迟。

工作原理

该系统结合使用了小型 LLM 主干网络(针对文本理解进行了优化)和名为 NeuCodec 的神经音频编解码器。这种架构允许模型处理文本并生成音频 Token,随后由编解码器将其转换为可听语音。它支持即时语音克隆,只需使用短促(3-15 秒)的音频样本及其对应的文本作为参考,即可模仿特定声音。

适用对象

专为开发嵌入式语音代理、本地 AI 助手、智能玩具以及对端侧处理有严格要求的合规安全应用而构建。

亮点

  • 端侧优化:提供 GGUF 量化,以便在移动和嵌入式硬件上进行高效推理。
  • 即时语音克隆:能够使用仅 3 秒的音频进行声音克隆。
  • 多语言支持:提供英语、西班牙语、德语和法语模型。
  • 情感控制:NeuTTS-2E 模型允许为固定说话人实现特定的情感表达(例如:快乐、悲伤、愤怒)。
  • 实时性能:能够在主流配置设备上实现实时生成。
  • 内置安全性:在生成的音频中包含感知阈值水印,以防止滥用。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目