BasedHardware/omi
AI that sees your screen, listens to your conversations and tells you what to do
它解決的問題
Omi 作為一個「第二個大腦」,能自動捕捉、轉錄並記住使用者在各種裝置上所看到和聽到的一切。它解決了遺忘會議或螢幕活動中重要細節的問題,提供一個可搜尋、由 AI 驅動的記憶系統,記錄使用者日常的數位與實體互動。
如何運作
Omi 使用跨平台生態系統實時捕捉資料:
- 捕捉:透過專用可穿戴裝置、macOS 應用程式或行動應用程式收集音訊與螢幕資料。
- 處理:資料傳送至基於 Python 的後端,透過 Deepgram 進行語音活躍檢測(VAD)、說話人辨識(detection)以及語音轉文字(STT)。
- 儲存與檢索:資訊儲存在 Firestore 中,並使用 Redis 快取,讓大型語言模型(LLM)能存取此歷史資料,以生成摘要、待辦事項,並在聊天介面中回答問題。
- 硬體:系統包含開源固件,適用於可穿戴裝置(nRF/Zephyr)與眼鏡(ESP32-S3),透過 BLE 通訊。
適用對象
- 需要追蹤大量會議與對話中待辦事項與摘要的專業人士。
- 對開發 AI 驅動的可穿戴硬體或整合自訂 AI 人格感興趣的開發者。
- 希望擁有完整、可搜尋的個人音訊與視覺輸入檔案庫的使用者。
特色亮點
- 多裝置支援:支援可穿戴裝置、macOS、iOS 與 Android。
- 全棧開源:包含從硬體設計、固件到後端 API 與前端應用程式的全部內容。
- 即時功能:具備即時轉錄與音訊串流處理流程。
- 可擴充性:提供多種語言的 SDK,以及用於整合的 MCP(Model Context Protocol)伺服器。
相關
- 專案
- 專案
- 專案
- 專案
- 專案