24kchengYe/MemoMind

Give your AI agent a brain that remembers. Local memory system for Claude Code — 100% private, GPU-accelerated, zero cloud dependency.

🧠 MemoMind – AI 코딩 에이전트를 위한 로컬 GPU 가속 메모리 시스템

무엇인가요 – MemoMind는 LLM 기반 코딩 어시스턴트에게 지속적이고 구조적인 '뇌'를 제공하는 자체 호스팅 시스템입니다. 어시스턴트가 배운 모든 내용(선호사항, 결정사항, 대화 사실, 일상 생활 이벤트)을 pgvector 임베딩과 지식 그래프 레이어로 강화된 PostgreSQL 데이터베이스에 저장합니다. 이후 에이전트는 새로운 사실을 보존하고, 4가지 방향의 하이브리드 검색(의미적, BM25, 그래프, 시계열)을 통해 가장 관련성이 높은 사실을 기억하며, 전체 기억을 반성하여 통찰을 도출할 수 있습니다.

왜 중요한가요 – 현재 대부분의 LLM 도구는 각 채팅을 새롭게 시작하는 것으로 간주합니다. MemoMind는 세션 간, 다양한 제공자(ChatGPT, Gemini, Claude) 간, 심지어 관련 없는 데이터 소스(당신의 DayLife 플래너) 간에도 컨텍스트를 유지합니다. 모든 데이터는 100% 로컬에 머무르며, 사용자의 GPU에서 빠른 임베딩을 수행하고 기계에서 절대 이탈하지 않아, 개인정보 보호와 비용 문제를 해결합니다.


핵심 기능 (README에 설명됨)

  • 로컬 저장소 – PostgreSQL + pgvector, 클라우드 의존 없음.
  • GPU 가속 임베딩 – NVIDIA GPU에서 bge‑m3 모델(1024차원) 사용; 항목당 약 50ms.
  • 4가지 방향 하이브리드 검색 – 의미적 유사성, BM25 키워드 검색, 그래프 기반 엔티티 연결, 시계열 필터 통합; 키워드 검색 ~20ms, 의미적 검색 ~400ms.
  • 자동 사실 추출 – 가벼운 LLM이 모든 가져온 대화에서 구조화된 사실을 추출.
  • 반성 연산 – 더 강력한 LLM이 전체 지식 기반을 기반으로 추론할 수 있음 (단순 검색이 아님).
  • 다국어 지원 – 임베딩은 100개 이상의 언어를 커버.
  • 보조 가져오기 도구 – ChatGPT, Gemini, DayLife 활동 로그를 한 번의 클릭으로 가져오기; 각 메모리가 원본 대화에 링크됨.
  • 웹 대시보드 – 지식 그래프, 타임라인 보기, 필터, JSON 내보내기 시각화.
  • 제로 수동 작업 – 에이전트가 무엇을 보존할지, 언제 기억할지 결정; 사용자는 서비스만 실행하면 됨.
  • 크로스 제공자 호환성 – OpenAI, Anthropic, Gemini, Groq, Ollama, LM Studio, 또는 어떤 OpenAI 호환 API와도 작동.
  • 백업 및 내보내기 – 한 번의 클릭으로 JSON 덤프, 주간에 선택적으로 개인 GitHub 리포지토리에 푸시.

일반적인 사용 사례

사용 사례 MemoMind의 도움
코딩 어시스턴트 선호하는 언어, 스타일, 기술 스택 결정, 과거 디버깅 시도를 기억하여 다음 세션은 올바른 컨텍스트에서 시작.
프로젝트 관리 결정사항, 마감일, 장애를 구조화된 기억으로 저장; 과거 이벤트를 반성하여 리스크를 파악.
디버깅 "이전에 무엇을 시도했는지"를 다시 입력하지 않고 검색 가능.
팀 온보딩 신규 멤버의 에이전트는 즉시 축적된 지식 그래프를 상속.
개인 생활 어시스턴트 DayLife 이벤트가 검색 가능한 사실이 되어 AI가 "마라톤을 마지막으로 달린 건 언제였나요?" 또는 "가장 일관성 있는 습관은 무엇인가요?"에 답할 수 있음.

아키텍처 개요 (텍스트 요약)

  1. 데이터베이스 계층 – PostgreSQL 17과 vector 확장(pgvector). 원시 기억, 임베딩, 그래프 관계를 저장.
  2. 임베딩 및 재랭킹bge‑m3는 로컬 NVIDIA GPU(CUDA 12.4)에서 실행. 각 기억에 대해 1024차원 벡터 생성.
  3. LLM 계층 – 두 모델 사용:
    • 새로운 대화에서 사실을 추출하기 위한 빠르고 저렴한 모델.
    • reflect 작업을 위한 더 강력한 모델(사용자 설정 가능).
  4. MCP(Model Context Protocol) 인터페이스 – 코딩 에이전트(Claude Code 등)가 stdio를 통해 호출할 수 있는 3개의 RPC 스타일 호출(retain, recall, reflect)을 노출.
  5. 대시보드 – 가벼운 Python 기반 웹 UI(dashboard.py)로 지식 그래프, 타임라인, 검색/필터 도구 시각화.
  6. 가져오기 파이프라인 – 작은 Python 스크립트(import_daylife.py, ChatGPT/Gemini 내보내기 도구)로 외부 데이터를 가져오고, 추출 LLM을 실행한 후 데이터베이스에 기록.

빠른 시작 요약 (Windows & Linux/WSL2)

  • 사전 요구 사항: NVIDIA GPU(권장), Python 3.11+, PostgreSQL 17, OpenAI 호환 API 키.
  • 설치:
    1. git clone https://github.com/24kchengYe/MemoMind.git
    2. 가상 환경 생성 후 제공된 requirements 설치 (Linux에서는 install.sh 실행).
    3. PostgreSQL과 pgvector 확장 설치 후 데이터베이스 생성 및 vector 확장 활성화.
    4. serve.py를 수정해 LLM API 키, 기본 URL, 모델 이름 추가.
    5. python serve.py 실행 (API: http://localhost:19999) 및 pythonw dashboard.py 실행 (UI: http://localhost:9999).
  • MCP 등록 – README에 기재된 claude mcp add … 명령어로 서비스를 Claude Code(또는 어떤 MCP 호환 에이전트)에 바인딩.
  • 자동 시작 – Windows 사용자는 start‑memomind.vbs를 시작 프로그램 폴더에 배치; Linux 사용자는 memomind.service systemd 유닛 활성화.

유사 프로젝트와의 차이점

기능 MemoMind Mem0 Graphiti/Zep Letta
로컬 전용 예 (100% 디바이스 내부) 클라우드 중심 (로컬 레이어 유료) 클라우드/BYOC 선택적 자체 호스팅
GPU 가속 임베딩 예 (CUDA) 아니요 아니요 아니요
4가지 방향 하이브리드 검색 의미적 + BM25 + 그래프 + 시계열 의미적 + 벡터만 의미적 + 그래프 에이전트 주도
내장 지식 그래프 pgvector 기반 KG Pro 기능 ($) Neo4j 코어 없음
시계열 추론 내장 없음 양방향 시계열 없음
비용 월 $0.30 미만 (로컬 컴퓨팅) 무료 ~ $249/월 무료 ~ $475/월 무료 ~ $200/월

MemoMind는 이미 MCP 기반 코딩 에이전트(예: Claude Code)를 사용하고 있으며, 빠른 GPU 기반 검색을 갖춘 깊이 있는 로컬 호스팅 메모리 저장소를 원하는 개발자를 위한 것입니다.


라이선스 및 커뮤니티

  • 라이선스: MIT (파일 LICENSE 참조).
  • 검증 배지: "MseeP Verified" – 외부 AI 툴링 감사 통과를 의미.
  • 플랫폼 지원: Windows, Linux, WSL2.
  • 문서화: README에는 설치 단계, 아키텍처 다이어그램, 데모 대시보드 포함.

결론

MemoMind는 LLM 기반 코딩 어시스턴트의 기억 상실 문제를 진정으로 해결하는 생산성 높은 오픈소스 시스템입니다. 벡터 기반 PostgreSQL 지식 그래프에 사실을 지속적으로 저장하고, 빠르고 GPU 가속 검색을 제공함으로써 AI 에이전트가 대화나 코딩 프로젝트를 정확히 중단한 지점에서 이어갈 수 있게 합니다. 모든 데이터는 개인 정보 보호를 유지하며, 운영 비용도 매우 낮습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트