BasedHardware/omi

AI that sees your screen, listens to your conversations and tells you what to do

它解決的問題

Omi 作為一個「第二個大腦」,能自動捕捉、轉錄並記住使用者在各種裝置上所看到和聽到的一切。它解決了遺忘會議或螢幕活動中重要細節的問題,提供一個可搜尋、由 AI 驅動的記憶系統,記錄使用者日常的數位與實體互動。

如何運作

Omi 使用跨平台生態系統實時捕捉資料:

  • 捕捉:透過專用可穿戴裝置、macOS 應用程式或行動應用程式收集音訊與螢幕資料。
  • 處理:資料傳送至基於 Python 的後端,透過 Deepgram 進行語音活躍檢測(VAD)、說話人辨識(detection)以及語音轉文字(STT)。
  • 儲存與檢索:資訊儲存在 Firestore 中,並使用 Redis 快取,讓大型語言模型(LLM)能存取此歷史資料,以生成摘要、待辦事項,並在聊天介面中回答問題。
  • 硬體:系統包含開源固件,適用於可穿戴裝置(nRF/Zephyr)與眼鏡(ESP32-S3),透過 BLE 通訊。

適用對象

  • 需要追蹤大量會議與對話中待辦事項與摘要的專業人士。
  • 對開發 AI 驅動的可穿戴硬體或整合自訂 AI 人格感興趣的開發者。
  • 希望擁有完整、可搜尋的個人音訊與視覺輸入檔案庫的使用者。

特色亮點

  • 多裝置支援:支援可穿戴裝置、macOS、iOS 與 Android。
  • 全棧開源:包含從硬體設計、固件到後端 API 與前端應用程式的全部內容。
  • 即時功能:具備即時轉錄與音訊串流處理流程。
  • 可擴充性:提供多種語言的 SDK,以及用於整合的 MCP(Model Context Protocol)伺服器。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案