hackers365/xiaozhi-esp32-server-golang
golang版本的小智后端服务,支持websocket和mqtt+udp协议,支持声纹识别/声音克隆/知识库/mcp远程调用/主动音频下发/openclaw等功能
何を解決するか
IoTおよびスマート音声シナリオに特化した高パフォーマンスでフルストリーミングAIバックエンドを提供し、ESP32デバイスやその他のエッジ端末が低遅延でリアルタイムAI音声インタラクションを実行できるようにします。
動作方法
このサーバーはGoで構築され、エンドツーエンドのストリーミングパイプラインを実装しています:音声活動検出(VAD)→ 音声認識(ASR)→ 大規模言語モデル(LLM)→ 音声合成(TTS)。トランスポート抽象化レイヤーを使用して複数のプロトコル(WebSocket、MQTT、UDP)をサポートし、LLMおよびTTSタスクの非同期処理にメッセージキューを活用しています。Einoフレームワークを介してさまざまなAIエンジンを統合し、設定および監視用のWebベースの管理コンソールも備えています。
対象ユーザー
ESP32ハードウェアを使用してAI搭載音声アシスタントやスマートホームデバイスを開発している開発者で、音声処理とエージェントロジックを扱うスケーラブルでモジュール式のバックエンドが必要な方。
主な特徴
- フルストリーミングパイプライン:音声入力から音声出力まで低遅延のリアルタイムインタラクション。
- 発話者識別:識別された発話者のアイデンティティに基づいてTTS音声を自動切り替え。
- モジュールアーキテクチャ:VAD、ASR、LLM、TTS、視覚機能用のプラグアンドプレイモジュール。
- 広範な統合:FunASR、OpenAI、Ollama、Doubao、EdgeTTS、CosyVoiceなど複数のエンジンをサポート。
- 高度なAI機能:Dify/RAGFlowを介したRAGサポート、音声クローン、ツール呼び出しとリソース管理のためのMCP(Model Context Protocol)を備える。
- 包括的な管理:視覚的な設定、遅延監視、OTA検証用のWebコンソール。
関連
- プロジェクト
- プロジェクト
akdeb/ElatoAIESP32デバイス上でリアルタイム音声AIモデルをデプロイするためのフレームワークで、エッジ関数を介して低遅延の音声対話を実現します。
- プロジェクト
huggingface/speech-to-speechSpeech‑to‑Speech は Hugging Face のオープンソースパイプラインで、音声入力を音声出力に変換します。VAD → STT → LLM → TTS の順に接続され、各コンポーネントは交換可能(Silero VAD、Parakeet/Faster‑Whisper/Whisper STT、OpenAI互換LLMまたはローカルのTransformers/MLXモデル、Qwen3‑TTSまたはその他のTTSバックエンド)。全体はWebSocket/WebRTCでOpenAI Realtimeプロトコルを実装しており、既存のOpenAI Agents SDKコードがそのまま動作します。`pip install speech-to-speech` でインストール後、`speech-to-speech serve`(サーバー)と `speech-to-speech talk`(クライアント)または `speech-to-speech local`(両方を同時に)を実行。ローカル専用動作、ローカル/ホストの混合LLM、Dockerデプロイ、代替TTS/STTモデルのオプション拡張をサポート。音声アシスタントロボット(例:Reachy Mini)や低レイテンシ音声AIアプリケーションに最適です。
- Dispatch
Reachy Mini ローカル音声バックエンド統合Hugging Face は Reachy Mini 用のローカル音声間音声パイプラインをリリースし、カスケードされた VAD、STT、LLM、TTS スタックを使用してロボットが会話を完全にローカルで処理できるようにしました。
- プロジェクト
espressif/esp-srESP‑SR is Espressif’s on‑device speech‑recognition framework for ESP32 MCUs. It bundles a tiny audio front‑end, wake‑word detection (WakeNet), voice‑activity detection (VADNet), offline command spotting (MultiNet), and speech synthesis, all optimized for low‑memory, low‑power chips. The library is modular, supports multiple languages, and lets developers add voice control to IoT devices without needing cloud services.