akdeb/ElatoAI

Realtime Voice AI with 100+ Models on Arduino ESP32 with Secure Websockets and Edge Functions for AI Companions, and Devices

解決的問題

ElatoAI 允許使用價格實惠的 ESP32 硬體建立即時語音 AI 裝置。它彌補了高階 AI 語音模型(如 OpenAI 的 Realtime API 或 Gemini Live)與低功耗 IoT 裝置之間的差距,讓使用者能建構實體 AI 玩具或助理,無需昂貴的內部處理即可進行長時間、不斷線的語音對話。

工作原理

此系統採用三層架構:

  1. ESP32 IoT 客戶端:一個硬體裝置,負責擷取音訊,使用 Opus 編碼器進行壓縮,並透過安全 WebSocket 將資料傳送到邊緣伺服器。
  2. 邊緣伺服器函數:託管於 Deno Edge 或 Cloudflare Workers 上,這些伺服器作為代理,管理 WebSocket 連線,並與各種 AI 提供商(OpenAI、Gemini、xAI、Eleven Labs 等)通訊。
  3. 前端客戶端:一個 Next.js 網頁應用,用於設定 AI 代理、管理裝置驗證,以及控制音量、語音音調等硬體設定。

適用對象

  • 希望將前沿語音 AI 整合到實體硬體中的 IoT 開發者與愛好者。
  • 正在製作 AI 驅動的玩具或互動裝置的創客。
  • 在邊緣基礎設施上實驗低延遲語音對語音管道的開發者。

主要特色

  • 廣泛模型支援:整合 OpenAI Realtime、Gemini Live、xAI Grok、Eleven Labs、Hume AI 與 Boson Higgs。
  • 優化音訊:使用 Opus 壓縮技術,在低頻寬(12kbps)下實現高品質音訊串流。
  • 邊緣效能:利用 Deno 與 Cloudflare Workers,維持全球低往返延遲。
  • 硬體友善:專為 ESP32-S3 設計,不需 PSRAM 即可運作。
  • 進階裝置功能:支援 OTA(空中更新)、WiFi 管理用的蜜罐入口,以及用於代理功能的工具呼叫。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案