Reachy Mini 本地語音後端整合
Reachy Mini 本地語音後端整合
Hugging Face 已經提出一種方法,可以讓 Reachy Mini 對話堆疊完全在本地運行,移除將音訊發送到遠端伺服器的需求。這是透過使用 speech-to-speech 庫實現的,該庫實現了一個級聯的 Voice Activity Detection (VAD)、Speech-to-Text (STT)、大型語言模型 (LLM) 和 Text-to-Speech (TTS) 管線,該管線暴露了一個與 Realtime API 相容的 /v1/realtime WebSocket。
本地管線元件與建議預設值
The speech-to-speech 庫採用級聯方法,允許使用者根據延遲、品質或語言支援需求交換個別元件。Hugging Face 為語音管線提供了以下帶有觀點的預設值:
| Stage | Choice | Rationale |
|---|---|---|
| VAD | Silero VAD v5 | 體積小、準確且在 CPU 上運行高效。 |
| STT | Parakeet-TDT 0.6B v3 | 快速、適合串流、且對英語具有高品質。 |
| TTS | Qwen3-TTS | 富有表現力、低延遲、多語言,並支援自訂聲音。 |
LLM 部署選項
LLM 是系統延遲的主要驅動因素。speech-to-speech 引擎透過 Responses API 協議支援多種部署策略,以將「大腦」與語音迴路解耦。
本地推理引擎
使用者可以使用以下幾種後端在本地運行模型:
- llama.cpp:建議用於一般本地使用。例如,使用 flash attention (
-fa on) 和全滑動窗口注意力快取 (--swa-full) 運行gemma-4-E4B-it-GGUF以優化提示處理。 - MLX (Apple Silicon):對 Mac 使用者而言是最低摩擦的選項,建議使用
Qwen3-4B-Instruct-2507以平衡速度與能力。 - Transformers :適合 CUDA、Linux,或希望在不進行權重轉換的情況下交換模型的使用者。
- vLLM (v0.21.0+):支援 Responses API 協議和工具呼叫串流。關鍵配置包括
--enable-auto-tool-choice、特定的--tool-call-parser,以及透過 `--default-chat-template-kwargs '{
Sources
- OriginalReachy Mini goes fully local