Reachy Mini 로컬 음성 백엔드 통합

Reachy Mini 로컬 음성 백엔드 통합

Hugging Face는 Reachy Mini 대화 스택을 완전히 로컬에서 실행할 수 있는 방법을 도입하여 원격 서버로 오디오를 전송할 필요성을 제거했습니다. 이는 speech-to-speech 라이브러리를 사용하여 달성되며, 이 라이브러리는 Voice Activity Detection (VAD), Speech-to-Text (STT), Large Language Model (LLM), Text-to-Speech (TTS)의 캐스케이드 파이프라인을 구현하여 Realtime API와 호환되는 /v1/realtime WebSocket을 노출합니다.

로컬 파이프라인 구성 요소 및 권장 기본값

speech-to-speech 라이브러리는 캐스케이드 접근 방식을 사용하여, 사용자가 지연 시간, 품질, 언어 지원 요구에 따라 개별 구성 요소를 교체할 수 있도록 합니다. Hugging Face는 음성 파이프라인에 다음과 같은 의견을 반영한 기본값을 제공합니다:

Stage Choice Rationale
VAD Silero VAD v5 작고 정확하며 CPU에서 효율적으로 실행됩니다.
STT Parakeet-TDT 0.6B v3 빠르고 스트리밍 친화적이며 영어에 대해 높은 품질을 제공합니다.
TTS Qwen3-TTS 표현력이 풍부하고 지연 시간이 낮으며 다국어를 지원하고 맞춤형 목소리를 지원합니다.

LLM 배포 옵션

LLM은 시스템 지연의 주요 원인입니다. speech-to-speech 엔진은 Responses API 프로토콜을 통해 '뇌'와 음성 루프를 분리하는 여러 배포 전략을 지원합니다.

로컬 추론 엔진

사용자는 여러 백엔드를 사용하여 모델을 로컬에서 실행할 수 있습니다:

  • llama.cpp: 일반 로컬 사용에 권장됩니다. 예를 들어, 플래시 어텐션(-fa on) 및 전체 슬라이딩 윈도우 어텐션 캐시(--swa-full)를 사용하여 gemma-4-E4B-it-GGUF를 실행하여 프롬프트 처리를 최적화할 수 있습니다.
  • MLX (Apple Silicon): Mac 사용자에게 가장 마찰이 적은 옵션이며, 속도와 기능의 균형을 위해 Qwen3-4B-Instruct-2507이 권장됩니다.
  • Transformers: CUDA, Linux, 또는 가중치 변환 없이 모델을 교체하고 싶은 사용자에게 적합합니다.
  • vLLM (v0.21.0+): Responses API 프로토콜과 툴 호출 스트리밍을 지원합니다. 주요 구성에는 --enable-auto-tool-choice, 특정 --tool-call-parser, 그리고 대화 중에 들을 수 있는 silenz을 방지하기 위해 reasoning 채널을 비활성화하는 `--default-chat-template-kwargs '{

Sources