ScreenMind: Gemma 4 기반 로컬 AI 화면 메모리

ScreenMind은 오픈 소스이며 100% 로컬에서 동작하는 AI 메모리 시스템으로, 화면 활동을 캡처하고 분석하여 사용자의 디지털 생활을 검색 가능한 히스토리로 만듭니다. Gemma 4 E2B의 멀티모달 기능을 활용함으로써, 클라우드 기반 화면 인식 AI에 대한 프라이버시 중심 대안을 제공하며, 네트워크 의존 없이 전적으로 사용자의 머신에서 동작합니다.

Gemma 4 E2B를 이용한 로컬 멀티모달 인텔리전스

ScreenMind은 llama.cpp를 통해 Gemma 4 E2B 모델을 활용하여 비전, 오디오, 추론 작업을 최소 4GB VRAM을 가진 하드웨어에서도 수행합니다. 시스템은 모델의 세 가지 모달리티를 모두 사용하도록 설계되었습니다:

  • Vision Analysis: 모든 스크린샷을 처리해 애플리케이션 이름, 활동 카테고리, 감정 분류, 그리고 보이는 요소와 레이아웃 영역에 대한 상세 인벤토리를 포함하는 구조화된 JSON을 반환합니다.
  • Audio Processing: Gemma 4 E2B에 내장된 오디오 인코더를 사용해 음성 메모와 회의 오디오(Zoom, Teams, Meet)를 외부 Whisper와 같은 의존성 없이 전사합니다.
  • Reasoning: 모델은 일일 요약을 생성하고, 대화형 RAG(검색 강화 생성) 채팅 인터페이스를 구동하며, 자동화 에이전트를 실행합니다.

성능과 자원 사용량의 균형을 맞추기 위해 ScreenMind은 세 가지 분석 모드를 제공합니다: Accurate(76초, 깊은 사고), Balanced(40초), Fast(~12초, 무사고 프리필 트릭 사용).

프라이버시 우선 아키텍처

ScreenMind은 화면 기록 AI와 관련된 프라이버시 문제를 해결하기 위해 데이터가 로컬 머신을 떠나지 않도록 설계되었습니다. 주요 보안 기능은 다음과 같습니다:

  • Local Execution: 클라우드 의존성 제로, 텔레메트리 없음.
  • Sensitive Data Filtering: 저장 전 신용카드 번호, 주민등록번호, API 키, 비밀번호 등을 자동으로 마스킹.
  • Encryption: Fernet과 OS 키링을 이용한 스크린샷 AES 암호화.
  • Access Control: 세션 기반 대시보드 PIN 잠금 및 설정 가능한 자동 잠금 시간.
  • Incognito Mode: 원클릭 토글로 모든 기록 및 분석 일시 중지.

기술 파이프라인 및 스택

ScreenMind은 다중 모델 파이프라인을 사용해 원시 픽셀을 검색 가능한 인텔리전스로 변환합니다. 워크플로우는 다음 순서를 따릅니다: ScreenshotEasyOCR (텍스트 추출) → Gemma 4 E2B (이해) → MiniLM-L6-v2 (시맨틱 임베딩) → SQLite + FTS5 (저장 및 인덱싱).

기술 스택

계층 기술 목적
AI 모델 Gemma 4 E2B 비전, 오디오, 추론
추론 llama-server GGUF 추론, OpenAI 호환 API
OCR EasyOCR 화면에서 원시 텍스트 추출
임베딩 all-MiniLM-L6-v2 시맨틱 검색을 위한 384차원 벡터
데이터베이스 SQLite (WAL) + FTS5 동시 읽기 및 전체 텍스트 검색
백엔드 FastAPI 비동기 REST API 및 시스템 오케스트레이션
프론트엔드 Vanilla JS/CSS 다크 글라스모피즘 SPA 대시보드

자동화 및 확장성

단순 기록을 넘어, ScreenMind은 화면 데이터를 기반으로 자동화를 구축할 수 있는 에이전트 플랫폼을 제공합니다. 두 가지 방법이 있습니다:

  1. AI 에이전트 (.md): 사용자는 평문 영어로 프롬프트를 작성할 수 있습니다. 예를 들어, "Daily Focus Report" 에이전트는 화면 활동을 분석해 깊은 작업 시간과 방해 점수를 계산합니다.
  2. Python 플러그인 (.py): 개발자는 ScreenMindSDK를 사용해 활동에 접근하고, 지속 상태를 관리하며, LLM 호출을 트리거할 수 있습니다.

ScreenMind은 또한 Model Context Protocol (MCP) Server를 구현해 화면 히스토리를 Claude Desktop, Cursor, VS Code와 같은 AI 도구에 노출합니다. 제공되는 도구에는 search_screen, get_recent_activity, get_daily_summary가 포함됩니다.

성능 최적화

백그라운드에서 지속적으로 실행되면서도 시스템 발자국을 최소화하기 위해 ScreenMind은 여러 최적화 전략을 적용합니다:

  • Smart Capture: 고정 타이머 대신 콘텐츠 변화 감지를 사용해 불필요한 스크린샷을 줄입니다.
  • Per-App pHash Cache: 3단계 캐시 시스템이 지각 해싱을 활용해 정적 화면에 대한 중복 추론 호출을 방지합니다.
  • GPU Priority: 채팅 요청이 들어오면 진행 중인 백그라운드 분석을 즉시 취소해 1초 이내에 GPU를 해제합니다.
  • Auto-Pause: 무거운 애플리케이션(예: 게임, 3D 소프트웨어)이 감지되면 자동으로 캡처를 중단합니다.

커뮤니티 관점

이 프로젝트는 Microsoft Recall에 대한 프라이버시 중심 대안으로 자리매김하고 있지만, 커뮤니티 토론에서는 화면 인식 AI에 대한 수요 자체가 제한적이라는 의견이 제시됩니다. 한 사용자는 Recall에 대한 반발이 이러한 기능에 대한 일반적인 수요 부족을 시사한다고 언급했습니다. 또한 일부 사용자는 Gemma E2B 모델의 일반 텍스트 생성 능력에 의문을 제기했지만, ScreenMind은 구조화된 비전 및 오디오 작업에만 모델을 활용하고 있습니다.

SUMMARY: ScreenMind은 오픈 소스이며 프라이버시를 최우선으로 하는 Microsoft Recall 대안으로, Gemma 4 E2B를 사용해 최소 4GB VRAM을 가진 GPU에서도 로컬에서 화면 히스토리를 캡처, 분석 및 검색합니다.

TITLE: ScreenMind: Gemma 4 기반 로컬 AI 화면 메모리

Sources