Intent-Lab/VisionClaw

Real-time AI assistant for Meta Ray-Ban smart glasses -- voice + vision + agentic actions via Gemini Live and OpenClaw

解決的問題

VisionClaw 將 Meta Ray-Ban 智能眼鏡轉換為即時 AI 助手。使用者可透過語音與環境互動,讓 AI 能看見使用者所見,並在各項應用與服務中代為執行動作。

工作原理

此系統透過 WebSocket 連接,整合 Meta Wearables DAT SDK 與 Gemini Live API。應用程式從麥克風擷取音訊,並從眼鏡相機以約 1fps 的速率擷取影片畫格,即時串流至 Gemini 以取得視覺與聽覺上下文。

為實現行動執行,本專案可選擇性整合 OpenClaw,一個本地閘道,讓 Gemini 可存取超過 56 種工具與連接的應用程式,執行發送訊息、管理購物清單、執行網路搜尋等任務。

適用對象

對具身 AI、智慧眼鏡整合與即時多模態 AI 代理感興趣的開發者與研究人員。

主要亮點

  • 即時多模態互動:使用 Gemini Live 進行原生音訊與視覺處理,無需額外的語音轉文字步驟。
  • 代理能力:整合 OpenClaw,可在訊息應用、智慧家居裝置與筆記中執行現實世界任務。
  • 跨平台支援:支援 iOS 與 Android。
  • 第一人稱視角串流:內建 WebRTC 實作,可將眼鏡的第一人稱視角即時分享至瀏覽器觀看者。
  • 手機模式:可使用智慧手機相機測試整個流程,無需智慧眼鏡。

相關

  • 專案
  • 專案
  • 專案
  • 專案