Reachy Mini ローカル音声バックエンド統合
Reachy Mini ローカル音声バックエンド統合
Hugging Face は、リモートサーバーに音声を送信する必要をなくし、Reachy Mini の会話スタックを完全にローカルで実行する方法を紹介しました。これは、speech-to-speech ライブラリを使用して実現されます。このライブラリは、Voice Activity Detection (VAD)、Speech-to-Text (STT)、Large Language Model (LLM)、Text-to-Speech (TTS) のカスケードパイプラインを実装し、Realtime API 互換の /v1/realtime WebSocket を公開します。
ローカルパイプラインコンポーネントと推奨デフォルト
The speech-to-speech library utilizes a cascaded approach, allowing users to swap individual components based on their needs for latency, quality, or language support. Hugging Face provides the following opinionated defaults for the voice pipeline:
| Stage | Choice | Rationale |
|---|---|---|
| VAD | Silero VAD v5 | 小型で精度が高く、CPU 上で効率的に動作します。 |
| STT | Parakeet-TDT 0.6B v3 | 高速でストリーミングに適しており、英語に対して高品質です。 |
| TTS | Qwen3-TTS | 表現力が豊かで低遅延、多言語対応、カスタムボイスをサポートします。 |
LLM デプロイオプション
The LLM is the primary driver of system latency. The speech-to-speech engine supports multiple deployment strategies to decouple the "brain" from the voice loop via the Responses API protocol.
ローカル推論エンジン
Users can run models locally using several backends:
- llama.cpp: 一般的なローカル使用に推奨されます。たとえば、
gemma-4-E4B-it-GGUFをフラッシュ注意 (-fa on) およびフルスライドウィンドウ注意キャッシュ (--swa-full) とともに実行し、プロンプト処理を最適化します。 - MLX (Apple Silicon): Mac ユーザーにとって最も摩擦の少ないオプションです。速度と能力のバランスを取るために
Qwen3-4B-Instruct-2507が推奨されます。 - Transformers: CUDA、Linux、または重み変換なしでモデルを交換したいユーザーに適しています。
- vLLM (v0.21.0+): Responses API プロトコルとツールコールストリーミングをサポートします。重要な設定には
--enable-auto-tool-choice、特定の--tool-call-parser、および理由付けチャネルの無効化 (`--default-chat-template-kwargs '{
Sources
- OriginalReachy Mini goes fully local