BasedHardware/omi

AI that sees your screen, listens to your conversations and tells you what to do

What it solves

Omiは、さまざまなデバイスを通じてユーザーが見聞きしたすべてを自動的にキャプチャ、文字起こし、記憶することで、「セカンドブレイン(第二の脳)」として機能します。会話や画面操作の重要な詳細を忘れてしまうという問題を、ユーザーの日常的なデジタルおよび物理的なインタラクションの検索可能なAI駆動メモリを提供することで解決します。

How it works

Omiは、クロスプラットフォームのエコシステムを使用してリアルタイムでデータを取得します:

  • Capture: 専用のウェアラブルデバイス、macOSアプリ、またはモバイルアプリを介して音声と画面データを収集します。
  • Processing: データはPythonベースのバックエンドに送信され、そこでVoice Activity Detection (VAD)、話者分離(異なる話者を識別)、およびDeepgram経由の音声文字起こし (STT) が処理されます。
  • Storage & Retrieval: 情報はFirestoreに保存され、Redisでキャッシュされるため、LLMがこの履歴にアクセスして要約、アクションアイテム、およびチャットインターフェースでの質問への回答を生成できます。
  • Hardware: システムには、BLE経由で通信するウェアラブル用(nRF/Zephyr)およびメガネ用(ESP32-S3)のオープンソースファームウェアが含まれます。

Who it’s for

  • 多数の会議や会話からアクションアイテムや要約を追跡する必要があるプロフェッショナル。
  • AI搭載のウェアラブルハードウェアの構築や、カスタムAIペルソナの統合に興味がある開発者。
  • 自身の生活における音声および視覚的な入力を包括的かつ検索可能なアーカイブとして残したいユーザー。

Highlights

  • Multi-device support: ウェアラブル、macOS、iOS、およびAndroidで動作します。
  • Full-stack open source: ハードウェア設計、ファームウェア、バックエンドAPI、フロントエンドアプリまで、すべてが含まれています。
  • Real-time capabilities: リアルタイムの文字起こしと音声ストリーミングパイプラインを備えています。
  • Extensible: 複数の言語向けのSDKと、統合のためのMCP (Model Context Protocol) サーバーを提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト