hackers365/xiaozhi-esp32-server-golang

golang版本的小智后端服务,支持websocket和mqtt+udp协议,支持声纹识别/声音克隆/知识库/mcp远程调用/主动音频下发/openclaw等功能

何を解決するか

IoTおよびスマート音声シナリオに特化した高パフォーマンスでフルストリーミングAIバックエンドを提供し、ESP32デバイスやその他のエッジ端末が低遅延でリアルタイムAI音声インタラクションを実行できるようにします。

動作方法

このサーバーはGoで構築され、エンドツーエンドのストリーミングパイプラインを実装しています:音声活動検出(VAD)→ 音声認識(ASR)→ 大規模言語モデル(LLM)→ 音声合成(TTS)。トランスポート抽象化レイヤーを使用して複数のプロトコル(WebSocket、MQTT、UDP)をサポートし、LLMおよびTTSタスクの非同期処理にメッセージキューを活用しています。Einoフレームワークを介してさまざまなAIエンジンを統合し、設定および監視用のWebベースの管理コンソールも備えています。

対象ユーザー

ESP32ハードウェアを使用してAI搭載音声アシスタントやスマートホームデバイスを開発している開発者で、音声処理とエージェントロジックを扱うスケーラブルでモジュール式のバックエンドが必要な方。

主な特徴

  • フルストリーミングパイプライン:音声入力から音声出力まで低遅延のリアルタイムインタラクション。
  • 発話者識別:識別された発話者のアイデンティティに基づいてTTS音声を自動切り替え。
  • モジュールアーキテクチャ:VAD、ASR、LLM、TTS、視覚機能用のプラグアンドプレイモジュール。
  • 広範な統合:FunASR、OpenAI、Ollama、Doubao、EdgeTTS、CosyVoiceなど複数のエンジンをサポート。
  • 高度なAI機能:Dify/RAGFlowを介したRAGサポート、音声クローン、ツール呼び出しとリソース管理のためのMCP(Model Context Protocol)を備える。
  • 包括的な管理:視覚的な設定、遅延監視、OTA検証用のWebコンソール。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト