Reachy Mini 本地語音後端整合

Reachy Mini 本地語音後端整合

Hugging Face 已經提出一種方法,可以讓 Reachy Mini 對話堆疊完全在本地運行,移除將音訊發送到遠端伺服器的需求。這是透過使用 speech-to-speech 庫實現的,該庫實現了一個級聯的 Voice Activity Detection (VAD)、Speech-to-Text (STT)、大型語言模型 (LLM) 和 Text-to-Speech (TTS) 管線,該管線暴露了一個與 Realtime API 相容的 /v1/realtime WebSocket。

本地管線元件與建議預設值

The speech-to-speech 庫採用級聯方法,允許使用者根據延遲、品質或語言支援需求交換個別元件。Hugging Face 為語音管線提供了以下帶有觀點的預設值:

Stage Choice Rationale
VAD Silero VAD v5 體積小、準確且在 CPU 上運行高效。
STT Parakeet-TDT 0.6B v3 快速、適合串流、且對英語具有高品質。
TTS Qwen3-TTS 富有表現力、低延遲、多語言,並支援自訂聲音。

LLM 部署選項

LLM 是系統延遲的主要驅動因素。speech-to-speech 引擎透過 Responses API 協議支援多種部署策略,以將「大腦」與語音迴路解耦。

本地推理引擎

使用者可以使用以下幾種後端在本地運行模型:

  • llama.cpp:建議用於一般本地使用。例如,使用 flash attention (-fa on) 和全滑動窗口注意力快取 (--swa-full) 運行 gemma-4-E4B-it-GGUF 以優化提示處理。
  • MLX (Apple Silicon):對 Mac 使用者而言是最低摩擦的選項,建議使用 Qwen3-4B-Instruct-2507 以平衡速度與能力。
  • Transformers :適合 CUDA、Linux,或希望在不進行權重轉換的情況下交換模型的使用者。
  • vLLM (v0.21.0+):支援 Responses API 協議和工具呼叫串流。關鍵配置包括 --enable-auto-tool-choice、特定的 --tool-call-parser,以及透過 `--default-chat-template-kwargs '{

Sources