kyutai-labs/unmute
Make text LLMs listen and speak
解决的问题
Unmute 使标准的文本型大语言模型(LLM)能够参与实时语音对话。通过集成高性能的语音转文本(STT)和文本转语音(TTS)模型,降低了语音接口通常伴随的延迟,弥合了文本 LLM 与语音交互之间的差距。
工作原理
Unmute 作为一个编排层,将专用音频模型包装在文本 LLM 之外:
- 语音转文本(STT):通过 WebSocket 连接实时转录用户音频输入。
- LLM 处理:当 STT 检测到用户说话结束时,将转录的文本发送给 LLM(如 Gemma 3 或通过 OpenRouter/vLLM 的模型)以生成文本回复。
- 文本转语音(TTS):将 LLM 的文本输出流式传输到 TTS 引擎,将其转换回音频并发送给用户。
适用人群
- 希望为其现有文本 LLM 添加低延迟语音功能的 开发者。
- 正在实验实时音频-文本-音频流水线的 研究人员。
- 希望使用开源模型构建私有语音 AI 助手的 自托管用户。
核心亮点
- 低延迟:优化的 STT 和 TTS 组件,确保对话流畅。
- LLM 无关:兼容任何 OpenAI 兼容的 LLM 服务器(vLLM、Ollama、OpenRouter)。
- 灵活部署:支持 Docker Compose 快速部署、无 Docker 手动控制,以及 Docker Swarm 扩展。
- 可自定义语音:通过配置文件可更改角色和语音。
相关
- 项目
- 项目
- 项目
- 项目
- 项目