BasedHardware/omi
AI that sees your screen, listens to your conversations and tells you what to do
What it solves
Omi는 다양한 기기에서 사용자가 보고 듣는 모든 것을 자동으로 캡처, 전사 및 기억함으로써 "두 번째 뇌" 역할을 합니다. 대화나 화면 활동의 중요한 세부 사항을 잊어버리는 문제를 사용자의 일상적인 디지털 및 물리적 상호 작용에 대한 검색 가능한 AI 기반 메모리를 제공함으로써 해결합니다.
How it works
Omi는 크로스 플랫폼 생태계를 사용하여 실시간으로 데이터를 캡처합니다:
- Capture: 전용 웨어러블 기기, macOS 앱 또는 모바일 앱을 통해 오디오 및 화면 데이터를 수집합니다.
- Processing: 데이터는 Python 기반 백엔드로 전송되어 Voice Activity Detection (VAD), 화자 분리(diarization), 그리고 Deepgram을 통한 음성-텍스트 변환(STT)을 처리합니다.
- Storage & Retrieval: 정보는 Firestore에 저장되고 Redis로 캐싱되어, LLM이 이 기록에 액세스하여 요약, 실행 항목 및 채팅 인터페이스에서 질문에 답변할 수 있습니다.
- Hardware: 시스템에는 BLE를 통해 통신하는 웨어러블용(nRF/Zephyr) 및 안경용(ESP32-S3) 오픈 소스 펌웨어가 포함됩니다.
Who it’s for
- 수많은 회의와 대화에서 실행 항목과 요약을 추적해야 하는 전문가.
- AI 기반 웨어러블 하드웨어를 구축하거나 커스텀 AI 페르소나를 통합하는 데 관심이 있는 개발자.
- 자신의 삶의 오디오 및 시각적 입력을 포괄적이고 검색 가능한 아카이브로 만들고 싶은 사용자.
Highlights
- Multi-device support: 웨어러블, macOS, iOS 및 Android에서 작동합니다.
- Full-stack open source: 하드웨어 설계와 펌웨어부터 백엔드 API 및 프론트엔드 앱까지 모두 포함됩니다.
- Real-time capabilities: 실시간 전사 및 오디오 스트리밍 파이프라인을 특징으로 합니다.
- Extensible: 여러 언어를 위한 SDK와 통합을 위한 MCP (Model Context Protocol) 서버를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트