kyutai-labs/unmute

Make text LLMs listen and speak

解决的问题

Unmute 使标准的文本型大语言模型(LLM)能够参与实时语音对话。通过集成高性能的语音转文本(STT)和文本转语音(TTS)模型,降低了语音接口通常伴随的延迟,弥合了文本 LLM 与语音交互之间的差距。

工作原理

Unmute 作为一个编排层,将专用音频模型包装在文本 LLM 之外:

  1. 语音转文本(STT):通过 WebSocket 连接实时转录用户音频输入。
  2. LLM 处理:当 STT 检测到用户说话结束时,将转录的文本发送给 LLM(如 Gemma 3 或通过 OpenRouter/vLLM 的模型)以生成文本回复。
  3. 文本转语音(TTS):将 LLM 的文本输出流式传输到 TTS 引擎,将其转换回音频并发送给用户。

适用人群

  • 希望为其现有文本 LLM 添加低延迟语音功能的 开发者
  • 正在实验实时音频-文本-音频流水线的 研究人员
  • 希望使用开源模型构建私有语音 AI 助手的 自托管用户

核心亮点

  • 低延迟:优化的 STT 和 TTS 组件,确保对话流畅。
  • LLM 无关:兼容任何 OpenAI 兼容的 LLM 服务器(vLLM、Ollama、OpenRouter)。
  • 灵活部署:支持 Docker Compose 快速部署、无 Docker 手动控制,以及 Docker Swarm 扩展。
  • 可自定义语音:通过配置文件可更改角色和语音。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目