Intent-Lab/VisionClaw

Real-time AI assistant for Meta Ray-Ban smart glasses -- voice + vision + agentic actions via Gemini Live and OpenClaw

解决的问题

VisionClaw 将 Meta Ray-Ban 智能眼镜转变为实时 AI 助手。用户可通过语音与环境互动,使 AI 能够看到用户所见,并在各种应用和服务中代表用户执行操作。

工作原理

该系统通过 WebSocket 连接,将 Meta Wearables DAT SDK 与 Gemini Live API 集成。应用程序从麦克风捕获音频,并从眼镜摄像头以约 1fps 的速率捕获视频帧,实时流式传输至 Gemini 以获取视觉和听觉上下文。

为实现行动执行,该项目可选择性地集成 OpenClaw,一个本地网关,为 Gemini 提供对 56 个以上工具和连接应用的访问权限,用于发送消息、管理购物清单和执行网络搜索等任务。

适用人群

对具身 AI、智能眼镜集成和实时多模态 AI 代理感兴趣的开发者和研究人员。

主要亮点

  • 实时多模态交互:使用 Gemini Live 进行原生音频和视觉处理,无需单独的语音转文本步骤。
  • 代理能力:与 OpenClaw 集成,可在消息应用、智能家居设备和笔记中执行现实世界任务。
  • 跨平台支持:支持 iOS 和 Android。
  • 第一人称视角流媒体:包含 WebRTC 实现,可将眼镜的第一人称视角实时共享至浏览器查看者。
  • 手机模式:允许使用智能手机摄像头测试整个流程,无需智能眼镜。

相关

  • 项目
  • 项目
  • 项目
  • 项目