akdeb/ElatoAI
Realtime Voice AI with 100+ Models on Arduino ESP32 with Secure Websockets and Edge Functions for AI Companions, and Devices
解決的問題
ElatoAI 允許使用價格實惠的 ESP32 硬體建立即時語音 AI 裝置。它彌補了高階 AI 語音模型(如 OpenAI 的 Realtime API 或 Gemini Live)與低功耗 IoT 裝置之間的差距,讓使用者能建構實體 AI 玩具或助理,無需昂貴的內部處理即可進行長時間、不斷線的語音對話。
工作原理
此系統採用三層架構:
- ESP32 IoT 客戶端:一個硬體裝置,負責擷取音訊,使用 Opus 編碼器進行壓縮,並透過安全 WebSocket 將資料傳送到邊緣伺服器。
- 邊緣伺服器函數:託管於 Deno Edge 或 Cloudflare Workers 上,這些伺服器作為代理,管理 WebSocket 連線,並與各種 AI 提供商(OpenAI、Gemini、xAI、Eleven Labs 等)通訊。
- 前端客戶端:一個 Next.js 網頁應用,用於設定 AI 代理、管理裝置驗證,以及控制音量、語音音調等硬體設定。
適用對象
- 希望將前沿語音 AI 整合到實體硬體中的 IoT 開發者與愛好者。
- 正在製作 AI 驅動的玩具或互動裝置的創客。
- 在邊緣基礎設施上實驗低延遲語音對語音管道的開發者。
主要特色
- 廣泛模型支援:整合 OpenAI Realtime、Gemini Live、xAI Grok、Eleven Labs、Hume AI 與 Boson Higgs。
- 優化音訊:使用 Opus 壓縮技術,在低頻寬(12kbps)下實現高品質音訊串流。
- 邊緣效能:利用 Deno 與 Cloudflare Workers,維持全球低往返延遲。
- 硬體友善:專為 ESP32-S3 設計,不需 PSRAM 即可運作。
- 進階裝置功能:支援 OTA(空中更新)、WiFi 管理用的蜜罐入口,以及用於代理功能的工具呼叫。
相關
- 專案
- 專案
- 專案
- 專案
- 專案