xinnan-tech/xiaozhi-esp32-server
本项目为xiaozhi-esp32提供后端服务,帮助您快速搭建ESP32设备控制服务器。Backend service for xiaozhi-esp32, helps you quickly build an ESP32 device control server.
解決的問題
本專案為開源智慧硬體專案 xiaozhi-esp32 提供了一個全面的後端伺服器。它透過處理硬體本身無法完成的語音互動、視覺感知與裝置控制等複雜處理過程,使基於 ESP32 的裝置能夠作為 AI 助手運行。
工作原理
伺服器充當 ESP32 硬體與各種 AI 服務之間的閘道。它使用 MQTT、UDP 與 WebSocket 協定與裝置通訊。系統整合了多個模組化組件:
- 語音流水線:結合自動語音辨識 (ASR)、語音活動檢測 (VAD) 與文字轉語音 (TTS),實現即時音訊互動。
- 智慧核心:連接大型語言模型 (LLM) 與視覺語言模型 (VLLM),進行推理與多模態互動。
- 擴充能力:實現了記憶系統(短期與智慧檢索)、基於 RAG 的知識庫(透過 RAGFlow)以及用於函式呼叫的意圖辨識系統。
- 管理:包括用於使用者、裝置與系統配置的 Web 控制面板。
適用對象
- 擁有 ESP32 硬體並希望託管自己的私有 AI 助手後端的開發者與愛好者。
- 希望使用 MCP (Model Context Protocol) 或 IoT 協定構建自定義智慧家庭整合的使用者。
亮點
- 多模態互動:同時支援語音與視覺感知 (VLLM)。
- 聲紋辨識:可以辨識不同的說話者以提供個人化回應。
- 靈活整合:支援廣泛的第三方 API(阿里雲、DeepSeek、OpenAI 等)與本地部署(Ollama、FunASR)。
- 低延遲:提供「串流配置」,可將回應時間顯著縮短約 2.5 秒。
- 可擴充性:具有用於新增自定義工具與函式呼叫功能的插件系統。
相關
- 專案
- 專案
- 專案
- 專案
- 專案