hackers365/xiaozhi-esp32-server-golang
golang版本的小智后端服务,支持websocket和mqtt+udp协议,支持声纹识别/声音克隆/知识库/mcp远程调用/主动音频下发/openclaw等功能
解决的问题
提供一个专为物联网和智能语音场景设计的高性能、全流式AI后端,使ESP32设备及其他边缘终端能够以低延迟实现实时AI语音交互。
工作原理
该服务器基于Go构建,实现端到端的流式处理管道:语音活动检测(VAD)→ 自动语音识别(ASR)→ 大型语言模型(LLM)→ 文本转语音(TTS)。通过传输抽象层支持多种协议(WebSocket、MQTT、UDP),并使用消息队列实现LLM和TTS任务的异步处理。通过Eino框架集成多种AI引擎,并包含一个基于Web的管理控制台用于配置和监控。
适用人群
使用ESP32硬件开发AI驱动的语音助手或智能家居设备的开发者,需要一个可扩展、模块化的后端来处理语音处理和代理逻辑。
主要亮点
- 全流式处理管道:从语音输入到音频输出实现低延迟的实时交互。
- 说话人识别:根据识别出的说话人身份自动切换TTS语音。
- 模块化架构:支持VAD、ASR、LLM、TTS及视觉功能的即插即用模块。
- 广泛集成:支持多种引擎,包括FunASR、OpenAI、Ollama、Doubao、EdgeTTS和CosyVoice。
- 高级AI功能:通过Dify/RAGFlow支持RAG,具备语音克隆、MCP(模型上下文协议)以实现工具调用和资源管理。
- 全面管理功能:提供Web控制台,支持可视化配置、延迟监控和OTA验证。
相关
- 项目
- 项目
- 项目
huggingface/speech-to-speechSpeech‑to‑Speech 是 Hugging Face 的开源管道,将语音输入转换为语音输出。它串联 VAD → STT → LLM → TTS,每个组件均可替换(Silero VAD、Parakeet/Faster‑Whisper/Whisper STT、任何 OpenAI 兼容 LLM 或本地 Transformers/MLX 模型、Qwen3‑TTS 或其他 TTS 后端)。整个系统通过 WebSocket/WebRTC 实现 OpenAI Realtime 协议,因此现有的 OpenAI Agents SDK 代码可直接使用。通过单个 `pip install speech-to-speech` 安装后,运行 `speech-to-speech serve`(服务器)和 `speech-to-speech talk`(客户端)或 `speech-to-speech local`(两者一起)。支持纯本地运行、本地/托管 LLM 混合、Docker 部署,以及可选扩展以使用替代 TTS/STT 模型。专为语音助手机器人(如 Reachy Mini)和低延迟语音 AI 应用设计。
- Dispatch
Reachy Mini 本地语音后端集成Hugging Face 为 Reachy Mini 发布了一个本地语音到语音管道,使机器人能够使用级联的 VAD、STT、LLM 和 TTS 堆栈完全在本地处理对话。
- 项目
espressif/esp-srESP‑SR is Espressif’s on‑device speech‑recognition framework for ESP32 MCUs. It bundles a tiny audio front‑end, wake‑word detection (WakeNet), voice‑activity detection (VADNet), offline command spotting (MultiNet), and speech synthesis, all optimized for low‑memory, low‑power chips. The library is modular, supports multiple languages, and lets developers add voice control to IoT devices without needing cloud services.