Reachy Mini 本地语音后端集成
Reachy Mini 本地语音后端集成
Hugging Face 推出了一种方法,使 Reachy Mini 对话栈能够完全在本地运行,从而无需将音频发送到远程服务器。这是通过使用 speech-to-speech 库实现的,该库实现了一个级联管道,包含 Voice Activity Detection (VAD)、Speech-to-Text (STT)、大型语言模型 (LLM) 和 Text-to-Speech (TTS),并暴露出一个与 Realtime API 兼容的 /v1/realtime WebSocket。
本地管道组件及推荐默认值
speech-to-speech 库采用级联方法,使用户可以根据延迟、质量或语言支持的需求交换单个组件。Hugging Face 为语音管道提供了以下默认配置:
| Stage | Choice | Rationale |
|---|---|---|
| VAD | Silero VAD v5 | 小巧、准确,且在 CPU 上运行高效。 |
| STT | Parakeet-TDT 0.6B v3 | 快速、适合流式处理,且英文质量高。 |
| TTS | Qwen3-TTS | 表达力强、低延迟、多语言,并支持自定义声音。 |
LLM 部署选项
LLM 是系统延迟的主要驱动因素。speech-to-speech 引擎通过 Responses API 协议支持多种部署策略,以将“大脑”与语音循环解耦。
本地推理引擎
用户可以使用以下几种后端在本地运行模型:
- llama.cpp: 推荐用于一般本地使用。例如,运行
gemma-4-E4B-it-GGUF并启用 flash attention (-fa on) 以及完整的滑动窗口注意力缓存 (--swa-full) 以优化提示处理。 - MLX (Apple Silicon): 对 Mac 用户而言是最低摩擦的选择,推荐使用
Qwen3-4B-Instruct-2507以在速度和能力之间取得平衡。 - Transformers: 适用于 CUDA、Linux,或希望在不进行权重转换的情况下更换模型的用户。
- vLLM (v0.21.0+): 支持 Responses API 协议和工具调用流式传输。关键配置包括
--enable-auto-tool-choice、特定的--tool-call-parser,以及禁用推理通道(`--default-chat-template-kwargs '{
Sources
- OriginalReachy Mini goes fully local