hackers365/xiaozhi-esp32-server-golang
golang版本的小智后端服务,支持websocket和mqtt+udp协议,支持声纹识别/声音克隆/知识库/mcp远程调用/主动音频下发/openclaw等功能
解決的問題
提供一個專為物聯網與智慧語音情境設計的高效率、全串流AI後端,讓ESP32裝置及其他邊緣終端能以低延遲實現即時AI語音互動。
工作原理
此伺服器以Go建構,實作端對端串流處理流程:語音活動偵測(VAD)→ 自動語音辨識(ASR)→ 大型語言模型(LLM)→ 文字轉語音(TTS)。透過傳輸抽象層支援多種通訊協定(WebSocket、MQTT、UDP),並使用訊息佇列處理LLM與TTS任務的非同步運作。透過Eino框架整合多種AI引擎,並內建基於Web的管理控制台,用於設定與監控。
適用對象
使用ESP32硬體開發AI驅動語音助理或智慧家居裝置的開發者,需要一個可擴展、模組化的後端來處理語音處理與代理邏輯。
主要特色
- 全串流處理流程:從語音輸入到音訊輸出實現低延遲的即時互動。
- 說話人識別:根據識別出的說話人身分自動切換TTS語音。
- 模組化架構:支援VAD、ASR、LLM、TTS及視覺功能的即插即用模組。
- 廣泛整合:支援多種引擎,包括FunASR、OpenAI、Ollama、Doubao、EdgeTTS與CosyVoice。
- 進階AI功能:透過Dify/RAGFlow支援RAG,具備語音克隆、MCP(模型上下文協定)以實現工具呼叫與資源管理。
- 全面管理功能:提供Web控制台,支援視覺化設定、延遲監控與OTA驗證。
相關
- 專案
- 專案
- 專案
huggingface/speech-to-speechSpeech‑to‑Speech 是 Hugging Face 的開源管道,將語音輸入轉換為語音輸出。它串接 VAD → STT → LLM → TTS,每個元件均可替換(Silero VAD、Parakeet/Faster‑Whisper/Whisper STT、任何 OpenAI 相容 LLM 或本機 Transformers/MLX 模型、Qwen3‑TTS 或其他 TTS 後端)。整個系統透過 WebSocket/WebRTC 實作 OpenAI Realtime 協定,因此現有的 OpenAI Agents SDK 代碼可直接使用。透過單一 `pip install speech-to-speech` 安裝後,執行 `speech-to-speech serve`(伺服器)和 `speech-to-speech talk`(客戶端)或 `speech-to-speech local`(兩者一起)。支援純本機運行、本機/託管 LLM 混合、Docker 部署,以及可選擴充以使用替代 TTS/STT 模型。專為語音助手機器人(如 Reachy Mini)和低延遲語音 AI 應用設計。
- Dispatch
Reachy Mini 本地語音後端整合Hugging Face 已為 Reachy Mini 發布了一個本地語音轉語音管線,使機器人能夠使用級聯的 VAD、STT、LLM 和 TTS 堆疊完全在本地處理對話。
- 專案
espressif/esp-srESP‑SR is Espressif’s on‑device speech‑recognition framework for ESP32 MCUs. It bundles a tiny audio front‑end, wake‑word detection (WakeNet), voice‑activity detection (VADNet), offline command spotting (MultiNet), and speech synthesis, all optimized for low‑memory, low‑power chips. The library is modular, supports multiple languages, and lets developers add voice control to IoT devices without needing cloud services.