xinnan-tech/xiaozhi-esp32-server
本项目为xiaozhi-esp32提供后端服务,帮助您快速搭建ESP32设备控制服务器。Backend service for xiaozhi-esp32, helps you quickly build an ESP32 device control server.
解決する課題
このプロジェクトは、オープンソースのインテリジェントハードウェアプロジェクトである xiaozhi-esp32 のための包括的なバックエンドサーバーを提供します。ハードウェア自体では実行できない音声対話、視覚認識、デバイス制御の複雑な処理を処理することで、ESP32 ベースのデバイスを AI アシスタントとして機能させます。
仕組み
サーバーは、ESP32 ハードウェアとさまざまな AI サービス間のゲートウェイとして機能します。MQTT、UDP、WebSocket プロトコルを使用してデバイスと通信します。システムは以下のモジュール化されたコンポーネントを統合しています:
- 音声パイプライン: 自動音声認識 (ASR)、音声活動検知 (VAD)、およびテキスト読み上げ (TTS) を組み合わせ、リアルタイムのオーディオ対話を可能にします。
- インテリジェンスコア: 大規模言語モデル (LLM) および視覚言語モデル (VLLM) に接続し、推論とマルチモーダルな対話を実現します。
- 拡張機能: メモリシステム(短期およびインテリジェント検索)、RAG ベースのナレッジベース(RAGFlow 経由)、および関数呼び出しのための意図認識システムを実装しています。
- 管理: ユーザー、デバイス、およびシステム設定用の Web ベースのコントロールパネルが含まれています。
対象者
- ESP32 ハードウェアを所有しており、独自のプライベートな AI アシスタント バックエンドをホストしたい開発者やホビーユーザー。
- MCP (Model Context Protocol) または IoT プロトコルを使用して、カスタムスマートホーム統合を構築したいユーザー。
ハイライト
- マルチモーダル対話: 音声と視覚認識 (VLLM) の両方をサポート。
- 声紋認識: 異なる話者を識別して、パーソナライズされた応答を提供できます。
- 柔軟な統合: 幅広いサードパーティ API (Aliyun, DeepSeek, OpenAI など) とローカルデプロイ (Ollama, FunASR) をサポート。
- 低遅延: レスポンス時間を約 2.5 秒大幅に短縮する「ストリーミング構成」を提供。
- 拡張性: カスタムツールや関数呼び出し機能を追加するためのプラグインシステムを搭載。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト