kyutai-labs/pocket-tts

A TTS that fits in your CPU (and pocket)

解决的问题

Pocket TTS 是一个轻量级的文本转语音(TTS)应用程序,无需昂贵的 GPU 或外部 Web API。它允许用户直接在本地 CPU 上从文本生成高质量音频,提供一种快速、私密且高效的语音生成方式。

工作原理

该项目使用一个小型模型(1亿参数)进行 CPU 执行优化。支持音频流式传输和语音克隆功能,其中一段短音频样本(wav 文件)可用于创建语音嵌入(语音状态),模型将使用该嵌入生成特定语音的语音。支持多种语言,包括英语、法语、德语、葡萄牙语、意大利语和西班牙语。

适用人群

专为希望在不依赖 GPU 硬件的情况下将 TTS 功能集成到应用程序中的开发者,以及希望使用简单 CLI 或 Web 界面进行本地语音生成的用户设计。

主要亮点

  • CPU 优化:在 CPU 上高效运行,在 MacBook Air M4 上仅使用 2 个 CPU 核心即可实现最高 6 倍实时速度。
  • 低延迟:约 200ms 内即可提供首个音频块。
  • 语音克隆:可从普通 wav 文件或预计算的 safetensors 嵌入中克隆语音。
  • 多语言支持:支持六种主要欧洲语言。
  • 灵活部署:提供 Python API、CLI 和本地 HTTP 服务器,社区还提供了 WebAssembly、Rust、C++ 和 C# 的移植版本。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目