hackers365/xiaozhi-esp32-server-golang

golang版本的小智后端服务,支持websocket和mqtt+udp协议,支持声纹识别/声音克隆/知识库/mcp远程调用/主动音频下发/openclaw等功能

解決的問題

提供一個專為物聯網與智慧語音情境設計的高效率、全串流AI後端,讓ESP32裝置及其他邊緣終端能以低延遲實現即時AI語音互動。

工作原理

此伺服器以Go建構,實作端對端串流處理流程:語音活動偵測(VAD)→ 自動語音辨識(ASR)→ 大型語言模型(LLM)→ 文字轉語音(TTS)。透過傳輸抽象層支援多種通訊協定(WebSocket、MQTT、UDP),並使用訊息佇列處理LLM與TTS任務的非同步運作。透過Eino框架整合多種AI引擎,並內建基於Web的管理控制台,用於設定與監控。

適用對象

使用ESP32硬體開發AI驅動語音助理或智慧家居裝置的開發者,需要一個可擴展、模組化的後端來處理語音處理與代理邏輯。

主要特色

  • 全串流處理流程:從語音輸入到音訊輸出實現低延遲的即時互動。
  • 說話人識別:根據識別出的說話人身分自動切換TTS語音。
  • 模組化架構:支援VAD、ASR、LLM、TTS及視覺功能的即插即用模組。
  • 廣泛整合:支援多種引擎,包括FunASR、OpenAI、Ollama、Doubao、EdgeTTS與CosyVoice。
  • 進階AI功能:透過Dify/RAGFlow支援RAG,具備語音克隆、MCP(模型上下文協定)以實現工具呼叫與資源管理。
  • 全面管理功能:提供Web控制台,支援視覺化設定、延遲監控與OTA驗證。

相關

  • 專案
  • 專案
  • 專案
  • Dispatch
  • 專案