xinnan-tech/xiaozhi-esp32-server

本项目为xiaozhi-esp32提供后端服务,帮助您快速搭建ESP32设备控制服务器。Backend service for xiaozhi-esp32, helps you quickly build an ESP32 device control server.

解决的问题

本项目为开源智能硬件项目 xiaozhi-esp32 提供了一个全面的后端服务器。它通过处理硬件本身无法完成的语音交互、视觉感知和设备控制等复杂处理过程,使基于 ESP32 的设备能够作为 AI 助手运行。

工作原理

服务器充当 ESP32 硬件与各种 AI 服务之间的网关。它使用 MQTT、UDP 和 WebSocket 协议与设备通信。系统集成了多个模块化组件:

  • 语音流水线:结合自动语音识别 (ASR)、语音活动检测 (VAD) 和文本转语音 (TTS),实现实时音频交互。
  • 智能核心:连接大语言模型 (LLM) 和视觉语言模型 (VLLM),进行推理和多模态交互。
  • 扩展能力:实现了记忆系统(短期和智能检索)、基于 RAG 的知识库(通过 RAGFlow)以及用于函数调用的意图识别系统。
  • 管理:包括用于用户、设备和系统配置的 Web 控制面板。

适用对象

  • 拥有 ESP32 硬件并希望托管自己的私有 AI 助手后端的开发者和爱好者。
  • 希望使用 MCP (Model Context Protocol) 或 IoT 协议构建自定义智能家居集成的用户。

亮点

  • 多模态交互:同时支持语音和视觉感知 (VLLM)。
  • 声纹识别:可以识别不同的说话者以提供个性化响应。
  • 灵活集成:支持广泛的第三方 API(阿里云、DeepSeek、OpenAI 等)和本地部署(Ollama、FunASR)。
  • 低延迟:提供“流式配置”,可将响应时间显著缩短约 2.5 秒。
  • 可扩展性:具有用于添加自定义工具和函数调用功能的插件系统。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目