akdeb/ElatoAI
Realtime Voice AI with 100+ Models on Arduino ESP32 with Secure Websockets and Edge Functions for AI Companions, and Devices
해결하는 문제
ElatoAI는 저렴한 ESP32 하드웨어를 사용하여 실시간 음성 AI 장치를 만들 수 있게 해줍니다. OpenAI의 Realtime API나 Gemini Live와 같은 고수준 AI 음성 모델과 저전력 IoT 장치 사이의 격차를 메우며, 비용이 많이 드는 내장 처리를 필요로 하지 않고도 긴 시간 동안 끊김 없이 음성 대화를 할 수 있는 물리적 AI 장난감이나 어시스턴트를 구축할 수 있게 해줍니다.
작동 방식
이 시스템은 3계층 아키텍처를 사용합니다:
- ESP32 IoT 클라이언트: 오디오를 캡처하고 Opus 코덱으로 압축하여 보안 WebSocket을 통해 엣지 서버로 전송하는 하드웨어 장치입니다.
- 엣지 서버 함수: Deno Edge 또는 Cloudflare Workers에서 호스팅되는 서버로, WebSocket 연결을 관리하고 OpenAI, Gemini, xAI, Eleven Labs 등 다양한 AI 제공업체와 통신합니다.
- 프론트엔드 클라이언트: AI 에이전트 설정, 장치 인증 관리, 볼륨 및 음성 톤 조절과 같은 하드웨어 설정을 제어하는 데 사용되는 Next.js 웹 애플리케이션입니다.
대상 사용자
- 물리적 하드웨어에 최신 음성 AI를 통합하고 싶은 IoT 개발자 및 애호가.
- AI 기반 장난감이나 인터랙티브 기기를 제작하는 제작자.
- 엣지 인프라에서 저지연 음성 대 음성 파이프라인을 실험하는 개발자.
주요 특징
- 광범위한 모델 지원: OpenAI Realtime, Gemini Live, xAI Grok, Eleven Labs, Hume AI, Boson Higgs와 통합 가능.
- 최적화된 오디오: 12kbps의 낮은 대역폭에서 고품질 오디오 스트리밍을 가능하게 하는 Opus 압축 사용.
- 엣지 성능: Deno와 Cloudflare Workers를 활용해 글로벌적으로 낮은 라운드트립 지연을 유지.
- 하드웨어 친화적: ESP32-S3 전용이며, PSRAM이 필요하지 않습니다.
- 고급 장치 기능: OTA(무선) 업데이트, WiFi 관리를 위한 캡티브 포털, 에이전트 기능을 위한 도구 호출을 지원.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트