Intent-Lab/VisionClaw
Real-time AI assistant for Meta Ray-Ban smart glasses -- voice + vision + agentic actions via Gemini Live and OpenClaw
何を解決するか
VisionClawは、Meta Ray-BanスマートグラスをリアルタイムAIアシスタントに変換します。ユーザーが音声で環境とやり取りできるようにし、AIがユーザーが見ているものを認識し、さまざまなアプリやサービスで行動を代行できます。
動作方法
このシステムは、Meta Wearables DAT SDKとGemini Live APIをWebSocket接続経由で統合しています。アプリはマイクからの音声と、グラスのカメラから取得した動画フレーム(約1fpsに制限)をキャプチャし、Geminiにリアルタイムの視覚的・聴覚的情報としてストリーミングします。
行動を実行可能にするために、プロジェクトはオプションでOpenClawと統合しています。OpenClawはローカルゲートウェイであり、Geminiが56以上のツールや接続されたアプリにアクセスできるようにし、メッセージの送信、ショッピングリストの管理、Web検索などのタスクを実行できます。
対象ユーザー
身体的なAI、スマートグラスの統合、リアルタイムマルチモーダルAIエージェントに興味を持つ開発者および研究者。
特徴
- リアルタイムマルチモーダルインタラクション: 別途音声認識処理を必要とせず、Gemini Liveのネイティブな音声および視覚処理を使用。
- エージェント機能: OpenClawと統合し、メッセージアプリ、スマートホームデバイス、ノートなど、現実世界のタスクを実行可能。
- クロスプラットフォーム対応: iOSおよびAndroidの両方に対応。
- POVストリーミング: WebRTC実装により、グラスの視点をリアルタイムでブラウザで視聴可能。
- スマートフォンモード: スマートグラスではなくスマートフォンのカメラを使って、パイプライン全体をテスト可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト