Intent-Lab/VisionClaw

Real-time AI assistant for Meta Ray-Ban smart glasses -- voice + vision + agentic actions via Gemini Live and OpenClaw

何を解決するか

VisionClawは、Meta Ray-BanスマートグラスをリアルタイムAIアシスタントに変換します。ユーザーが音声で環境とやり取りできるようにし、AIがユーザーが見ているものを認識し、さまざまなアプリやサービスで行動を代行できます。

動作方法

このシステムは、Meta Wearables DAT SDKとGemini Live APIをWebSocket接続経由で統合しています。アプリはマイクからの音声と、グラスのカメラから取得した動画フレーム(約1fpsに制限)をキャプチャし、Geminiにリアルタイムの視覚的・聴覚的情報としてストリーミングします。

行動を実行可能にするために、プロジェクトはオプションでOpenClawと統合しています。OpenClawはローカルゲートウェイであり、Geminiが56以上のツールや接続されたアプリにアクセスできるようにし、メッセージの送信、ショッピングリストの管理、Web検索などのタスクを実行できます。

対象ユーザー

身体的なAI、スマートグラスの統合、リアルタイムマルチモーダルAIエージェントに興味を持つ開発者および研究者。

特徴

  • リアルタイムマルチモーダルインタラクション: 別途音声認識処理を必要とせず、Gemini Liveのネイティブな音声および視覚処理を使用。
  • エージェント機能: OpenClawと統合し、メッセージアプリ、スマートホームデバイス、ノートなど、現実世界のタスクを実行可能。
  • クロスプラットフォーム対応: iOSおよびAndroidの両方に対応。
  • POVストリーミング: WebRTC実装により、グラスの視点をリアルタイムでブラウザで視聴可能。
  • スマートフォンモード: スマートグラスではなくスマートフォンのカメラを使って、パイプライン全体をテスト可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト