Reachy Mini ローカル音声バックエンド統合

Reachy Mini ローカル音声バックエンド統合

Hugging Face は、リモートサーバーに音声を送信する必要をなくし、Reachy Mini の会話スタックを完全にローカルで実行する方法を紹介しました。これは、speech-to-speech ライブラリを使用して実現されます。このライブラリは、Voice Activity Detection (VAD)、Speech-to-Text (STT)、Large Language Model (LLM)、Text-to-Speech (TTS) のカスケードパイプラインを実装し、Realtime API 互換の /v1/realtime WebSocket を公開します。

ローカルパイプラインコンポーネントと推奨デフォルト

The speech-to-speech library utilizes a cascaded approach, allowing users to swap individual components based on their needs for latency, quality, or language support. Hugging Face provides the following opinionated defaults for the voice pipeline:

Stage Choice Rationale
VAD Silero VAD v5 小型で精度が高く、CPU 上で効率的に動作します。
STT Parakeet-TDT 0.6B v3 高速でストリーミングに適しており、英語に対して高品質です。
TTS Qwen3-TTS 表現力が豊かで低遅延、多言語対応、カスタムボイスをサポートします。

LLM デプロイオプション

The LLM is the primary driver of system latency. The speech-to-speech engine supports multiple deployment strategies to decouple the "brain" from the voice loop via the Responses API protocol.

ローカル推論エンジン

Users can run models locally using several backends:

  • llama.cpp: 一般的なローカル使用に推奨されます。たとえば、gemma-4-E4B-it-GGUF をフラッシュ注意 (-fa on) およびフルスライドウィンドウ注意キャッシュ (--swa-full) とともに実行し、プロンプト処理を最適化します。
  • MLX (Apple Silicon): Mac ユーザーにとって最も摩擦の少ないオプションです。速度と能力のバランスを取るために Qwen3-4B-Instruct-2507 が推奨されます。
  • Transformers: CUDA、Linux、または重み変換なしでモデルを交換したいユーザーに適しています。
  • vLLM (v0.21.0+): Responses API プロトコルとツールコールストリーミングをサポートします。重要な設定には --enable-auto-tool-choice、特定の --tool-call-parser、および理由付けチャネルの無効化 (`--default-chat-template-kwargs '{

Sources