ScreenMind: 基于 Gemma 4 的本地 AI 屏幕记忆

ScreenMind 提供了一个 100% 本地、私密的 AI 记忆系统,利用 Gemma 4 E2B 模型捕获并分析屏幕活动。通过在用户自己的硬件上处理视觉、音频和推理任务,它消除了对云端的依赖和遥测,为 Microsoft Recall 等屏幕感知 AI 工具提供了一个安全的替代方案。

使用 Gemma 4 E2B 实现本地多模态智能

ScreenMind 使用 Gemma 4 E2B 模型作为其核心智能引擎,因为它是唯一一个能够在保持足够小、足以在 4GB VRAM GPU 上后台运行的同时,原生处理视觉、音频和推理任务的模型。

视觉与截图分析

每张捕获的截图都由 Gemma 4 处理以生成结构化的 JSON 数据,包括:

  • 活动识别:应用名称、活动类别以及当前任务的详细摘要。
  • 场景理解:对可见元素和空间布局区域(例如,侧边栏、工具栏)的丰富描述。
  • 情感分析:情绪分类和置信度评分。

为了平衡性能和深度,ScreenMind 提供三种分析模式:Accurate(约 76 秒,带有深度思考)、Balanced(约 40 秒,带有思考)和 Fast(约 12 秒,使用无思考预填充技巧和用于布局的 OCR 聚类)。

原生音频处理

与许多依赖 Whisper 等外部依赖项的 AI 工具不同,ScreenMind 利用 Gemma 4 E2B 的原生音频编码器进行:

  • 语音备忘录:通过系统级热键(Ctrl+Shift+V)即时转录捕获的音频。
  • 会议转录:自动检测 Zoom、Teams 或 Google Meet 并使用 map-reduce 摘要法对长会话进行记录、转录和摘要。

推理与 RAG

ScreenMind 采用以文本为优先的检索增强生成(RAG)系统,并带有视觉回退机制。这允许用户通过与屏幕记忆进行对话来检索特定信息,例如 Discord 上特定联系人的消息,或者生成深度推理的每日摘要。

隐私优先架构与安全性

ScreenMind 旨在解决与屏幕录制 AI 相关的隐私担忧,通过确保数据永远不会离开本地机器来解决这些问题。

  • 零云端依赖:所有推理均通过 llama.cpp 在本地执行。不向外部服务器发送任何遥测数据。
  • 敏感数据过滤:系统在存储数据之前会自动脱敏处理信用卡号、社会保障号码、API 密钥和密码。
  • 静态加密:截图使用集成了操作系统密钥环的 AES 加密(Fernet)进行保护。
  • 访问控制:仪表板包含一个带有可配置自动锁定超时时间的 PIN 码锁,以及一个一键式“隐身模式”以暂停所有录制。

技术流水线与系统设计

ScreenMind 使用多模型流水线将原始像素转换为可搜索的记忆:

  1. 捕获mss 库根据内容变化检测而非固定计时器来捕获屏幕。
  2. OCR:EasyOCR 从屏幕中提取原始文本,然后将其作为上下文提供给 Gemma 4。
  3. 理解:Gemma 4 E2B 分析图像和 OCR 文本以对活动进行分类。
  4. 嵌入:MiniLM-L6-v2 为自然语言搜索生成语义向量。
  5. 存储:数据存储在 SQLite (WAL) 中,并带有 FTS5 索引,以便同时进行关键词和语义搜索。

性能优化

为了保持系统响应能力,ScreenMind 实施了多种 GPU 管理策略:

  • pHash 缓存:针对静态屏幕的三层每应用感知哈希缓存减少了冗于的推理调用。
  • 对话优先级:当用户发起对话时,正在进行的后台分析会立即被取消,以便在不到一秒钟内释放 GPU。
  • 自动暂停:当检测到重型应用(如 3D 软件或游戏)时,系统会自动停止捕获。

可扩展性:智能体与 MCP Server

ScreenMind 包含一个可编程层,允许用户在屏幕数据之上构建自动化流程。

智能体平台

用户可以用两种格式创建智能体:

  • Markdown Agents (.md):定义了时间表和数据要求的英文提示词(例如, timelinemoodurls)。示例智能体包括“每日焦点报告”和“Code Changelog”。
  • Python Plugins (.py):为开发者提供完整的 SDK 访问权限,以实现状态持久化和复杂逻辑。

MCP 集成

通过模型上下文协议(MCP)服务器,ScreenMind 将其历史记录暴露给 Claude Desktop、Cursor 和 VS Code 等 AI 工具。可用工具包括 search_screenget_recent_activityget_daily_summary

社区观点

虽然该项目强调隐私和本地执行,但一些用户对底层模型的性能提出了疑问。一位用户指出,他们发现 Gemma-E4B 在通用文本生成方面“太‘笨’了”,并质疑 ScreenMind 如何实现高质量的结果。此外,一些观察者指出,对 Microsoft Recall 的抵触情绪表明,市场对屏幕感知 AI 存在更广泛的怀疑,无论隐私实现方式如何。

Sources