akdeb/ElatoAI
Realtime Voice AI with 100+ Models on Arduino ESP32 with Secure Websockets and Edge Functions for AI Companions, and Devices
解决的问题
ElatoAI 允许使用价格实惠的 ESP32 硬件创建实时语音 AI 设备。它弥合了高级 AI 语音模型(如 OpenAI 的 Realtime API 或 Gemini Live)与低功耗物联网设备之间的差距,使用户能够构建物理 AI 玩具或助手,无需昂贵的本地处理即可进行长时间、不间断的语音对话。
工作原理
该系统采用三层架构:
- ESP32 IoT 客户端:一个硬件设备,用于捕获音频,使用 Opus 编码器进行压缩,并通过安全 WebSocket 将其发送到边缘服务器。
- 边缘服务器函数:托管在 Deno Edge 或 Cloudflare Workers 上,这些服务器充当代理,管理 WebSocket 连接并与各种 AI 提供商(OpenAI、Gemini、xAI、Eleven Labs 等)通信。
- 前端客户端:一个 Next.js 网页应用,用于配置 AI 代理、管理设备认证以及控制硬件设置(如音量和语音音调)。
适用人群
- 希望将前沿语音 AI 集成到物理硬件中的 IoT 开发者和爱好者。
- 正在制作 AI 驱动的玩具或互动设备的创客。
- 在边缘基础设施上实验低延迟语音到语音管道的开发者。
主要亮点
- 广泛模型支持:支持 OpenAI Realtime、Gemini Live、xAI Grok、Eleven Labs、Hume AI 和 Boson Higgs。
- 优化音频:使用 Opus 压缩技术,在低带宽(12kbps)下实现高质量音频流。
- 边缘性能:利用 Deno 和 Cloudflare Workers 实现全球低往返延迟。
- 硬件友好:专为 ESP32-S3 设计,无需 PSRAM 即可运行。
- 高级设备功能:支持 OTA(空中升级)、WiFi 管理的蜜罐门户,以及用于代理功能的工具调用。
相关
- 项目
- 项目
- 项目
- 项目
- 项目