ScreenMind: 由 Gemma 4 提供驅動的本地 AI 螢幕記憶

ScreenMind 提供一個 100% 本地、私密的 AI 記憶系統,使用 Gemma 4 E2B 模型來擷取並分析螢幕活動。透過在使用者自己的硬體上處理視覺、音訊與推理任務,它消除了雲端依賴與遙測,為類似 Microsoft Recall 的螢幕感知 AI 工具提供了一個安全的替代方案。

使用 Gemma 4 E2B 的本地多模態智能

ScreenMind 使用 Gemma 4 E2B 模型作為其核心智能引擎,因為它是唯一能夠原生處理視覺、音訊與推理,同時體積小到足以在 4GB VRAM 的 GPU 上於背景執行的小型模型。

視覺與螢幕截圖分析

每一張擷取的螢幕截圖都會由 Gemma 4 進行處理以生成結構化的 JSON 資料,包括:

  • 活動識別:應用程式名稱、活動類別,以及當前任務的詳細摘要。
  • 場景理解:對可見元素與空間佈局區域(例如:側邊欄、工具列)的豐富描述。
  • 情緒分析:情緒分類與信心分數。

為了在效能與深度之間取得平衡,ScreenMind 提供三種分析模式:Accurate(約 76 秒,包含深度思考)、Balanced(約 40 秒,包含思考)以及 Fast(約 12 秒,使用無思考預填技巧與 OCR 聚類進行佈局分析)。

原生音訊處理

與許多依賴 Whisper 等外部依賴項的 AI 工具不同,ScreenMind 利用 Gemma 4 E2B 的原生音訊編碼器來進行:

  • 語音備忘錄:透過系統全域熱鍵 (Ctrl+Shift+V) 即時轉錄擷取的音訊。
  • 會議轉錄:自動偵測 Zoom、Teams 或 Google Meet 並進行記錄、轉錄,並使用 map-reduce 摘要法處理長時段會議。

推理與 RAG

ScreenMind 採用以文字為優先的檢索增強生成 (RAG) 系統,並具備視覺回退機制。這讓使用者可以與其螢幕記憶進行對話,以檢索特定資訊,例如 Discord 上特定聯絡人的訊息,或是生成深度推理的每日摘要。

隱私優先的架構與安全性

ScreenMind 的設計旨在解決與螢幕錄製 AI 相關的隱私疑慮,透過確保數據從未離開過本地機器來達成。

  • 零雲端依賴:所有推理均透過 llama.cpp 在本地執行。不會向外部伺服器發送任何遙測數據。
  • 敏感數據過濾:系統會在數據儲存前自動遮蔽信用卡號碼、社會安全號碼、API keys 與密碼。
  • 靜態數據加密:螢幕截圖使用與作業系統金鑰庫整合的 AES 加密 (Fernet) 進行保護。
  • 存取控制:儀表板包含 PIN 碼鎖定,具備可配置的自動鎖定逾時設定,以及一鍵「隱身模式」以暫停所有錄製。

技術管線與系統設計

ScreenMind 使用多模型管線將原始像素轉換為可搜尋的記憶:

  1. 擷取mss 函式庫根據內容變動偵測而非固定計時器來擷取螢幕。
  2. OCR:EasyOCR 從螢幕中提取原始文字,隨後將其作為上下文提供給 Gemma 4。
  3. 理解:Gemma 4 E2B 分析圖像與 OCR 文字以進行活動類別化。
  4. 嵌入:MiniLM-L6-v2 為自然語言搜尋生成語義向量。
  5. 儲存:數據儲存在 SQLite (WAL) 中,並配備 FTS5 索引以同時進行關鍵字與語義搜尋。

效能優化

為了維持系統響應能力,ScreenMind 實施了幾種 GPU 管理策略:

  • pHash 緩存:針對每個應用程式的 3 層感知哈希緩存,減少了靜態螢幕的冗餘推理調用。
  • 對話優先權:當使用者啟動對話時,正在進行中的背景分析會立即被取消,以便在不到一秒內釋放 GPU。
  • 自動暫停:當偵測到重型應用程式(例如 3D 軟體或遊戲)時,系統會自動停止擷取。

可擴展性:代理人與 MCP 伺服器

ScreenMind 包含一個可程式化的層,允許使用者在螢幕數據之上建立自動化流程。

代理人平台

使用者可以透過兩種格式建立代理人:

  • Markdown Agents (.md):使用英文提示詞來定義排程與數據需求(例如:timeline, mood, urls)。範例代理人包括「每日焦點報告」與「程式碼變更日誌」。
  • Python Plugins (.py):開發者可獲得完整的 SDK 存取權限,以實作複雜邏輯與狀態持久化。

MCP 整合

透過 Model Context Protocol (MCP) 伺服器,ScreenMind 將其歷史記錄暴露給 Claude Desktop、Cursor 與 VS Code 等 AI 工具。可用的工具包括 search_screen, get_recent_activity, 與 get_daily_summary

社群觀點

雖然該專案強調隱私與本地執行,但部分使用者對底層模型的能力提出了疑問。一位使用者指出,他們發現 Gemma-E4B 在一般文字生成方面「太過『笨拙』」,並質疑 ScreenMind 如何能達成高品質的結果。此外,一些觀察者指出,對於 Microsoft Recall 的抵制,顯示出市場對螢幕感知 AI 的廣泛懷疑,無論其隱私實作方式如何。

Sources