BasedHardware/omi

AI that sees your screen, listens to your conversations and tells you what to do

它解决了什么问题

Omi 作为一个「第二大脑」,能够自动捕捉、转录并记住用户在各种设备上看到和听到的所有内容。它解决了人们忘记会议或屏幕活动中的重要细节的问题,提供了一个可搜索的、由人工智能驱动的记忆系统,记录用户日常的数字和物理互动。

它如何工作

Omi 使用跨平台生态系统实时捕获数据:

  • 捕获:通过专用可穿戴设备、macOS 应用或移动应用收集音频和屏幕数据。
  • 处理:数据发送到基于 Python 的后端,通过 Deepgram 处理语音活动检测(VAD)、说话人分离(识别不同说话人)和语音转文本(STT)。
  • 存储与检索:信息存储在 Firestore 中,并使用 Redis 缓存,使大语言模型(LLMs)能够访问这些历史记录,以生成摘要、待办事项,并在聊天界面中回答问题。
  • 硬件:系统包含开源固件,适用于可穿戴设备(nRF/Zephyr)和眼镜(ESP32-S3),通过 BLE 进行通信。

适合谁

  • 需要跟踪大量会议和对话中的待办事项和摘要的专业人士。
  • 对开发人工智能驱动的可穿戴硬件或集成自定义 AI 人格感兴趣的开发者。
  • 希望拥有全面、可搜索的生活音频和视觉输入存档的用户。

亮点

  • 多设备支持:支持可穿戴设备、macOS、iOS 和 Android。
  • 全栈开源:包含从硬件设计、固件到后端 API 和前端应用的全部内容。
  • 实时功能:具备实时转录和音频流处理管道。
  • 可扩展性:提供多种语言的 SDK 和用于集成的 MCP(模型上下文协议)服务器。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目