hackers365/xiaozhi-esp32-server-golang

golang版本的小智后端服务,支持websocket和mqtt+udp协议,支持声纹识别/声音克隆/知识库/mcp远程调用/主动音频下发/openclaw等功能

解决的问题

提供一个专为物联网和智能语音场景设计的高性能、全流式AI后端,使ESP32设备及其他边缘终端能够以低延迟实现实时AI语音交互。

工作原理

该服务器基于Go构建,实现端到端的流式处理管道:语音活动检测(VAD)→ 自动语音识别(ASR)→ 大型语言模型(LLM)→ 文本转语音(TTS)。通过传输抽象层支持多种协议(WebSocket、MQTT、UDP),并使用消息队列实现LLM和TTS任务的异步处理。通过Eino框架集成多种AI引擎,并包含一个基于Web的管理控制台用于配置和监控。

适用人群

使用ESP32硬件开发AI驱动的语音助手或智能家居设备的开发者,需要一个可扩展、模块化的后端来处理语音处理和代理逻辑。

主要亮点

  • 全流式处理管道:从语音输入到音频输出实现低延迟的实时交互。
  • 说话人识别:根据识别出的说话人身份自动切换TTS语音。
  • 模块化架构:支持VAD、ASR、LLM、TTS及视觉功能的即插即用模块。
  • 广泛集成:支持多种引擎,包括FunASR、OpenAI、Ollama、Doubao、EdgeTTS和CosyVoice。
  • 高级AI功能:通过Dify/RAGFlow支持RAG,具备语音克隆、MCP(模型上下文协议)以实现工具调用和资源管理。
  • 全面管理功能:提供Web控制台,支持可视化配置、延迟监控和OTA验证。

相关

  • 项目
  • 项目
  • 项目
  • Dispatch
  • 项目