78/xiaozhi-esp32

An MCP-based chatbot | 一个基于MCP的聊天机器人

何を解決するか

XiaoZhi は、ESP32 ハードウェア上で AI ベースの音声チャットボットを構築するためのオープンソースフレームワークです。低消費電力の組み込みデバイスと、Qwen や DeepSeek などの強力な大規模言語モデル(LLM)の間のギャップを埋め、リアルタイム音声インタラクションとハードウェア制御を可能にします。

動作方法

このプロジェクトは、S3、C3、C5、C6、P4 などのさまざまな ESP32 チッププラットフォーム向けのファームウェアを提供します。WebSocket またはハイブリッド MQTT+UDP プロトコルを通じてバックエンドサーバーに接続します。オフラインでの起動語検出には ESP-SR を使用し、高品質な音声インタラクションには Opus 音声ストリーミングを採用しています。システムは Model Context Protocol (MCP) を統合し、AI がローカルデバイスのハードウェア(LED、サーボ、GPIO)を制御したり、スマートホーム制御や知識検索などのクラウド側機能にアクセスできるようにしています。

対象ユーザー

  • ハードウェア愛好家および DIY 愛好家:自作の AI 音声アシスタントやロボットドッグを構築したい人。
  • 開発者:ESP32 エコシステムを使って LLM を組み込みシステムに統合したい人。
  • プロダクトデザイナー:AI ベースの IoT デバイスのプロトタイピングを行いたい人。

特徴

  • 広範なハードウェア対応:170 以上のリリースバリアントおよび 138 のボードディレクトリに対応。M5Stack や Espressif ESP-BOX を含む。
  • MCP 統合:デバイス側およびクラウド側のツール使用・制御に Model Context Protocol を採用。
  • マルチモーダル入力:カメラビジョン入力とスピーカー認識をサポートし、異なるユーザーを識別可能。
  • 柔軟なネットワーキング:Wi-Fi、有線イーサネット、USB RNDIS、4G ネットワークに対応。
  • リアルタイムインタラクション:AEC 対応ハードウェア上でリアルタイムエンドツーエンド音声モデルを使用し、フルデュプレックス対応。
  • カスタマイズ可能:ウェブベースのジェネレータでカスタム起動語、フォント、絵文字を設定可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト