Reachy Mini 本地语音后端集成

Reachy Mini 本地语音后端集成

Hugging Face 推出了一种方法,使 Reachy Mini 对话栈能够完全在本地运行,从而无需将音频发送到远程服务器。这是通过使用 speech-to-speech 库实现的,该库实现了一个级联管道,包含 Voice Activity Detection (VAD)、Speech-to-Text (STT)、大型语言模型 (LLM) 和 Text-to-Speech (TTS),并暴露出一个与 Realtime API 兼容的 /v1/realtime WebSocket。

本地管道组件及推荐默认值

speech-to-speech 库采用级联方法,使用户可以根据延迟、质量或语言支持的需求交换单个组件。Hugging Face 为语音管道提供了以下默认配置:

Stage Choice Rationale
VAD Silero VAD v5 小巧、准确,且在 CPU 上运行高效。
STT Parakeet-TDT 0.6B v3 快速、适合流式处理,且英文质量高。
TTS Qwen3-TTS 表达力强、低延迟、多语言,并支持自定义声音。

LLM 部署选项

LLM 是系统延迟的主要驱动因素。speech-to-speech 引擎通过 Responses API 协议支持多种部署策略,以将“大脑”与语音循环解耦。

本地推理引擎

用户可以使用以下几种后端在本地运行模型:

  • llama.cpp: 推荐用于一般本地使用。例如,运行 gemma-4-E4B-it-GGUF 并启用 flash attention (-fa on) 以及完整的滑动窗口注意力缓存 (--swa-full) 以优化提示处理。
  • MLX (Apple Silicon): 对 Mac 用户而言是最低摩擦的选择,推荐使用 Qwen3-4B-Instruct-2507 以在速度和能力之间取得平衡。
  • Transformers: 适用于 CUDA、Linux,或希望在不进行权重转换的情况下更换模型的用户。
  • vLLM (v0.21.0+): 支持 Responses API 协议和工具调用流式传输。关键配置包括 --enable-auto-tool-choice、特定的 --tool-call-parser,以及禁用推理通道(`--default-chat-template-kwargs '{

Sources