akdeb/ElatoAI

Realtime Voice AI with 100+ Models on Arduino ESP32 with Secure Websockets and Edge Functions for AI Companions, and Devices

解決する課題

ElatoAI は、手頃な価格の ESP32 ハードウェアを使用してリアルタイム音声AIデバイスを構築できるようにします。高レベルのAI音声モデル(OpenAIのRealtime APIやGemini Liveなど)と低消費電力のIoTデバイスの間のギャップを埋め、高価なオンボード処理を必要とせずに、長時間にわたる途切れのない音声会話が可能な物理的なAIおもちゃやアシスタントの開発を可能にします。

動作方法

システムは3層アーキテクチャを使用しています:

  1. ESP32 IoTクライアント:音声をキャプチャし、Opusコーデックで圧縮して、セキュアなWebSocket経由でエッジサーバーに送信するハードウェアデバイス。
  2. エッジサーバー関数:Deno EdgeまたはCloudflare Workers上でホストされるサーバーで、WebSocket接続を管理し、さまざまなAIプロバイダ(OpenAI、Gemini、xAI、Eleven Labsなど)と通信します。
  3. フロントエンドクライアント:AIエージェントの設定、デバイス認証の管理、音量や音声ピッチなどのハードウェア設定の制御に使用するNext.jsウェブアプリ。

対象ユーザー

  • 物理ハードウェアに先進的な音声AIを統合したいIoT開発者や趣味の開発者。
  • AI搭載のおもちゃやインタラクティブギミックを製作するマーカー。
  • エッジインフラ上で低レイテンシの音声対音声パイプラインを実験する開発者。

特徴

  • 広範なモデル対応:OpenAI Realtime、Gemini Live、xAI Grok、Eleven Labs、Hume AI、Boson Higgs と統合可能。
  • 最適化された音声:12kbpsの低帯域幅で高品質な音声ストリーミングを実現するOpus圧縮を使用。
  • エッジパフォーマンス:DenoとCloudflare Workersを活用し、グローバルに低ラウンドトリップ遅延を維持。
  • ハードウェアに優しい設計:ESP32-S3専用で、PSRAMを必要としない。
  • 高度なデバイス機能:OTA(オーバーザエア)アップデート、WiFi管理用キャプティブポータル、エージェント機能のためのツールコールをサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト