hackers365/xiaozhi-esp32-server-golang
golang版本的小智后端服务,支持websocket和mqtt+udp协议,支持声纹识别/声音克隆/知识库/mcp远程调用/主动音频下发/openclaw等功能
해결하는 문제
IoT 및 스마트 음성 시나리오에 특화된 고성능, 완전 스트리밍 AI 백엔드를 제공하여 ESP32 장치 및 기타 엣지 단말기가 낮은 지연 시간으로 실시간 AI 음성 상호작용을 수행할 수 있도록 합니다.
작동 방식
이 서버는 Go로 구축되었으며, 엔드투엔드 스트리밍 파이프라인을 구현합니다: 음성 활동 탐지(VAD) → 음성 인식(ASR) → 대규모 언어 모델(LLM) → 텍스트 음성 변환(TTS). 전송 추상화 계층을 사용하여 여러 프로토콜(WebSocket, MQTT, UDP)을 지원하며, LLM 및 TTS 작업의 비동기 처리를 위해 메시지 큐를 활용합니다. Eino 프레임워크를 통해 다양한 AI 엔진을 통합하고, 설정 및 모니터링을 위한 웹 기반 관리 콘솔도 포함합니다.
대상 사용자
ESP32 하드웨어를 사용하여 AI 기반 음성 어시스턴트 또는 스마트 홈 기기를 개발하는 개발자로, 음성 처리 및 에이전트 로직을 처리할 수 있는 확장 가능하고 모듈식 백엔드가 필요한 분들입니다.
주요 특징
- 완전 스트리밍 파이프라인: 음성 입력에서 음성 출력까지 저지연 실시간 상호작용.
- 발화자 식별: 식별된 발화자의 정체성에 따라 TTS 음성 자동 전환.
- 모듈식 아키텍처: VAD, ASR, LLM, TTS 및 시각 기능용 플러그 앤 플레이 모듈.
- 광범위한 통합: FunASR, OpenAI, Ollama, Doubao, EdgeTTS, CosyVoice 등 다양한 엔진 지원.
- 고급 AI 기능: Dify/RAGFlow를 통한 RAG 지원, 음성 클론, 도구 호출 및 리소스 관리를 위한 MCP(Model Context Protocol) 포함.
- 포괄적인 관리: 시각적 설정, 지연 시간 모니터링, OTA 검증을 위한 웹 콘솔.
관련
- 프로젝트
- 프로젝트
akdeb/ElatoAIESP32 장치에서 실시간 음성 AI 모델을 배포하기 위한 프레임워크로, 에지 함수를 통해 저지연 음성-대-음성 상호작용을 가능하게 합니다.
- 프로젝트
huggingface/speech-to-speechSpeech‑to‑Speech는 Hugging Face의 오픈소스 파이프라인으로, 음성 입력을 음성 출력으로 변환합니다. VAD → STT → LLM → TTS로 연결되며, 각 구성 요소는 교체 가능합니다 (Silero VAD, Parakeet/Faster‑Whisper/Whisper STT, OpenAI 호환 LLM 또는 로컬 Transformers/MLX 모델, Qwen3‑TTS 또는 기타 TTS 백엔드). 전체 시스템은 WebSocket/WebRTC를 통해 OpenAI Realtime 프로토콜을 구현하므로, 기존 OpenAI Agents SDK 코드가 그대로 작동합니다. `pip install speech-to-speech`로 설치 후 `speech-to-speech serve` (서버)와 `speech-to-speech talk` (클라이언트) 또는 `speech-to-speech local` (서버와 클라이언트를 함께)를 실행할 수 있습니다. 로컬 전용 작동, 로컬/호스팅 혼합 LLM, Docker 배포, 대체 TTS/STT 모델을 위한 선택적 확장 기능을 지원합니다. 음성 어시스턴트 로봇(예: Reachy Mini) 및 저지연 음성 AI 애플리케이션에 적합합니다.
- Dispatch
Reachy Mini 로컬 음성 백엔드 통합Hugging Face는 Reachy Mini용 로컬 음성-음성 파이프라인을 출시하여, 캐스케이드된 VAD, STT, LLM, TTS 스택을 사용해 로봇이 대화를 완전히 로컬에서 처리할 수 있도록 했습니다.
- 프로젝트
espressif/esp-srESP‑SR is Espressif’s on‑device speech‑recognition framework for ESP32 MCUs. It bundles a tiny audio front‑end, wake‑word detection (WakeNet), voice‑activity detection (VADNet), offline command spotting (MultiNet), and speech synthesis, all optimized for low‑memory, low‑power chips. The library is modular, supports multiple languages, and lets developers add voice control to IoT devices without needing cloud services.