ScreenMind: Gemma 4搭載のローカルAIスクリーンメモリ

ScreenMindは、Gemma 4 E2Bモデルを使用して画面アクティビティをキャプチャおよび分析する、100%ローカルでプライベートなAIメモリシステムを提供します。ビジョン、オーディオ、および推論タスクをユーザー自身のハードウェア上で処理することで、クラウドへの依存やテレメトリを排除し、Microsoft Recallのような画面認識AIツールに代わる安全な選択肢を提供します。

Gemma 4 E2Bによるローカル・マルチモーダル・インテリジェンス

ScreenMindは、Gemma 4 E2Bモデルを中央インテリジェンスエンジンとして利用しています。これは、ビジョン、オーディオ、および推論をネイティブに処理できる唯一のモデルでありながら、4GB VRAMのGPUでバックグラウンド実行できるほど軽量であるためです。

ビジョンおよびスクリーンショット分析

キャプチャされたすべてのスクリーンショットは、Gemma 4によって処理され、以下を含む構造化されたJSONデータが生成されます:

  • アクティビティの特定: アプリ名、アクティビティのカテゴリ、および現在のタスクの詳細な要約。
  • シーンの理解: 可視要素および空間レイアウト領域(例:サイドバー、ツールバー)の豊かな記述。
  • 感情分析: 気分分類と信頼度スコア。

パフォーマンスと深さのバランスをとるため、ScreenMindは3つの分析モードを提供します:Accurate(ディープシンキングを伴う約76秒)、Balanced(シンキングを伴う約40秒)、およびFast(シンキングなしのprefillトリックとレイアウト用のOCRクラスタリングを使用する約12秒)。

ネイティブ・オーディオ・プロセッシング

Whisperのような外部依存関係に頼る多くのAIツールとは異なり、ScreenMindはGemma 4 E2Bのネイティブ・オーディオ・エンコーダーを活用して以下を実現します:

  • ボイスメモ: システム全体のホットキー(Ctrl+Shift+V)を介してキャプチャされたオーディオの即時文字起こし。
  • 会議の文字起こし: Zoom、Teams、またはGoogle Meetを自動検出し、map-reduce要約法を用いて長いセッションの会議を記録、文字起こし、および要約します。

推論およびRAG

ScreenMindは、ビジョン・フォールバックを備えたテキスト優先の検索拡張生成(RAG)システムを採用しています。これにより、ユーザーは画面メモリとチャットすることで、Discord上の特定の連絡先からのメッセージなどの特定の情報を取得したり、高度な推論による日次要約を生成したりすることが可能です。

プライバシー第一のアーキテクチャとセキュリティ

ScreenMindは、画面録画AIに関連するプライバシーの懸念に対処するため、データがいかなる場合もローカルマシンから離れないように設計されています。

  • ゼロ・クラウド依存: すべての推論はllama.cppを介してローカルで実行されます。外部サーバーへのテレメトリは送信されません。
  • 機密データのフィルタリング: システムは、データが保存される前に、クレジットカード番号、社会保障番号、APIキー、およびパスワードを自動的に検閲(redact)します。
  • 保存時の暗号化: スクリーンショットは、OSのキーリングと統合されたAES暗号化(Fernet)を使用して保護されます。
  • アクセス制御: ダッシュボードには、設定可能な自動ロックタイムアウトを備えたPINロックがあり、ワンクリックの「Incognito Mode」で全録画を一時停止できます。

技術的パイプラインとシステム設計

ScreenMindは、生のピクセルを検索可能なメモリへと変換するために、マルチモデル・パイプラインを使用します:

  1. Capture: mssライブラリが、固定タイマーではなく、コンテンツの変化検出に基づいて画面をキャプチャします。
  2. OCR: EasyOCRが画面から生のテキストを抽出し、それをコンテキストとしてGemma 4に供給します。
  3. Understanding: Gemma 4 E2Bが画像とOCRテキストを分析してアクティビティを分類します。
  4. Embedding: MiniLM-L6-v2が自然言語検索のためのセマンティック・ベクトルを生成します。
  5. Storage: データは、キーワード検索とセマンティック検索を同時に行うためのFTS5インデックスを備えたSQLite (WAL) に保存されます。

パフォーマンス最適化

システムの応答性を維持するため、ScreenMindはいくつかのGPU管理戦略を実装しています:

  • pHash Caching: アプリごとの3段階の知覚的ハッシュ・キャッシュが、静的な画面に対する冗長な推論呼び出しを削減します。
  • Chat Priority: ユーザーがチャットを開始すると、実行中のバックグラウンド分析は即座にキャンセルされ、1秒未満でGPUを解放します。
  • Auto-Pause: 3Dソフトウェアやゲームなどの負荷の高いアプリケーションが検出された場合、システムは自動的にキャプチャを停止します。

拡張性:エージェントとMCPサーバー

ScreenMindは、画面データに基づいて自動化を構築できるプログラマブルなレイヤーを含んでいます。

エージェント・プラットフォーム

ユーザーは2つの形式でエージェントを作成できます:

  • Markdown Agents (.md): スケジュールとデータ要件(例:timeline, mood, urls)を定義する英語のプロンプトです。エージェントの例として、「Daily Focus Report」や「Code Changelog」があります。
  • Python Plugins (.py): 開発者が状態の永続化や複雑なロジックを実装するためのフルSDKアクセスを提供します。

MCP統合

Model Context Protocol (MCP) サーバーを通じて、ScreenMindはClaude Desktop、Cursor、およびVS CodeなどのAIツールにその履歴をエらずに公開します。利用可能なツールは、search_screen, get_recent_activity, get_daily_summaryです。

コミュニティの視点

プロジェクトはプライバシーとローカル実行を強調していますが、一部のユーザーは基盤となるモデルの能力について疑問を呈しています。あるユーザーは、Gemma-E4Bが一般的なテキスト生成において「あまりに『賢くない』」と指摘し、ScreenMindがどのようにして高品質な結果を得ているのか疑問を視点点として挙げました。また、一部の観察者は、Microsoft Recallに対する反発が、プライバシーの実装方法に関わらず、画面認識AIに対する市場全体の懐疑的な視点を示唆していると指摘しています。

Sources