hackers365/xiaozhi-esp32-server-golang

golang版本的小智后端服务,支持websocket和mqtt+udp协议,支持声纹识别/声音克隆/知识库/mcp远程调用/主动音频下发/openclaw等功能

해결하는 문제

IoT 및 스마트 음성 시나리오에 특화된 고성능, 완전 스트리밍 AI 백엔드를 제공하여 ESP32 장치 및 기타 엣지 단말기가 낮은 지연 시간으로 실시간 AI 음성 상호작용을 수행할 수 있도록 합니다.

작동 방식

이 서버는 Go로 구축되었으며, 엔드투엔드 스트리밍 파이프라인을 구현합니다: 음성 활동 탐지(VAD) → 음성 인식(ASR) → 대규모 언어 모델(LLM) → 텍스트 음성 변환(TTS). 전송 추상화 계층을 사용하여 여러 프로토콜(WebSocket, MQTT, UDP)을 지원하며, LLM 및 TTS 작업의 비동기 처리를 위해 메시지 큐를 활용합니다. Eino 프레임워크를 통해 다양한 AI 엔진을 통합하고, 설정 및 모니터링을 위한 웹 기반 관리 콘솔도 포함합니다.

대상 사용자

ESP32 하드웨어를 사용하여 AI 기반 음성 어시스턴트 또는 스마트 홈 기기를 개발하는 개발자로, 음성 처리 및 에이전트 로직을 처리할 수 있는 확장 가능하고 모듈식 백엔드가 필요한 분들입니다.

주요 특징

  • 완전 스트리밍 파이프라인: 음성 입력에서 음성 출력까지 저지연 실시간 상호작용.
  • 발화자 식별: 식별된 발화자의 정체성에 따라 TTS 음성 자동 전환.
  • 모듈식 아키텍처: VAD, ASR, LLM, TTS 및 시각 기능용 플러그 앤 플레이 모듈.
  • 광범위한 통합: FunASR, OpenAI, Ollama, Doubao, EdgeTTS, CosyVoice 등 다양한 엔진 지원.
  • 고급 AI 기능: Dify/RAGFlow를 통한 RAG 지원, 음성 클론, 도구 호출 및 리소스 관리를 위한 MCP(Model Context Protocol) 포함.
  • 포괄적인 관리: 시각적 설정, 지연 시간 모니터링, OTA 검증을 위한 웹 콘솔.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트