xinnan-tech/xiaozhi-esp32-server

本项目为xiaozhi-esp32提供后端服务,帮助您快速搭建ESP32设备控制服务器。Backend service for xiaozhi-esp32, helps you quickly build an ESP32 device control server.

해결하는 문제

이 프로젝트는 오픈 소스 지능형 하드웨어 프로젝트인 xiaozhi-esp32를 위한 포괄적인 백엔드 서버를 제공합니다. 하드웨어 자체에서 수행할 수 없는 음성 상호작용, 시각적 인지 및 장치 제어의 복잡한 처리를 처리함으로써 ESP32 기반 장치가 AI 어시스턴트로 작동할 수 있도록 합니다.

작동 방식

서버는 ESP32 하드웨어와 다양한 AI 서비스 사이의 게이트웨이 역할을 합니다. MQTT, UDP 및 WebSocket 프로토콜을 사용하여 장치와 통신합니다. 시스템은 다음과 같은 모듈형 구성 요소를 통합합니다:

  • 음성 파이프라인: 자동 음성 인식(ASR), 음성 활동 감지(VAD) 및 텍스트 음성 변환(TTS)을 결합하여 실시간 오디오 상호작용을 가능하게 합니다.
  • 지능 코어: 추론 및 멀티모달 상호작용을 위해 대규모 언어 모델(LLM) 및 시각-언어 모델(VLLM)에 연결됩니다.
  • 확장 기능: 메모리 시스템(단기 및 지능형 검색), RAG 기반 지식 베이스(RAGFlow를 통해) 및 함수 호출을 위한 의도 인식 시스템을 구현합니다.
  • 관리: 사용자, 장치 및 시스템 구성을 위한 웹 기반 제어 패널이 포함됩니다.

대상 사용자

  • ESP32 하드웨어를 소유하고 있으며 자체 프라이빗 AI 어시스턴트 백엔드를 호스팅하려는 개발자 및 취미가.
  • MCP(Model Context Protocol) 또는 IoT 프로토콜을 사용하여 맞춤형 스마트 홈 통합을 구축하려는 사용자.

주요 특징

  • 멀티모달 상호작용: 음성 및 시각적 인지(VLLM)를 모두 지원합니다.
  • 음성 인식: 서로 다른 화자를 식별하여 개인화된 응답을 제공할 수 있습니다.
  • 유연한 통합: 다양한 서드파티 API(Aliyun, DeepSeek, OpenAI 등) 및 로컬 배포(Ollama, FunASR)를 지원합니다.
  • 저지연: 응답 시간을 약 2.5초 정도 크게 단축하는 "스트리밍 구성"을 제공합니다.
  • 확장성: 커스텀 도구 및 함수 호출 기능을 추가하기 위한 플러그인 시스템을 갖추고 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트