clusterzx/paperless-ai

An automated document analyzer for Paperless-ngx using OpenAI API, Ollama, Deepseek-r1, Azure and all OpenAI API compatible Services to automatically analyze and tag your documents.

📄 Paperless‑AI – Paperless‑ngx용 AI 강화 문서 관리

무엇인가요 – 자체 호스팅 문서 아카이브 Paperless‑ngx 에 연결되는 오픈소스 확장 프로그램입니다. 새로 업로드된 파일을 감시하고, 텍스트를 LLM(OpenAI 호환 서비스, Ollama, Gemini 등)에 전송하여 자동으로:

  • 제목 생성 및 태그/문서 유형 선택
  • LLM에서 유도한 메타데이터를 Paperless‑ngx에 저장
  • 전체 아카이브에 대해 자연어 질문이 가능한 벡터 인덱스 구축 (RAG 채팅)

왜 중요한가요 – 수동 라벨링 없이 정적 PDF 저장소를 검색 가능한 지식 기반으로 전환합니다. 중간 처리(임베딩, 분류, 채팅)는 지정한 호환 LLM이 담당하므로, 온프레미스(Ollama)에 데이터를 보관하거나 클라우드 API를 사용할 수 있습니다.


핵심 기능

기능 제공되는 기능
자동 처리 새로운 문서 감지, 텍스트 추출, 선택한 LLM 호출, 제목, 태그, 연락처 등 기록
다중 모델 지원 Ollama(Mistral, Llama, Phi‑3, Gemma‑2 …), OpenAI, DeepSeek, OpenRouter, Perplexity, Together, LiteLLM, VLLM, FastChat, Gemini 및 모든 OpenAI 호환 엔드포인트 지원
RAG 기반 채팅 문서에서 생성된 의미 벡터 저장소; "내 임대 계약서는 언제 서명했나요?" 와 같은 자연어 질문에 출처 인용과 함께 자연어 답변 제공
수동 UI /manual 페이지에서 단일 문서에 대해 AI를 실행 가능. 메타데이터 저장 전에 검토하고 싶은 민감한 파일에 유용
스마트 태그 및 규칙 처리 대상 문서 제한 필터, 프롬프트 on/off, LLM 출력을 사용자 정의 태그로 매핑 가능
Docker 준비 완료 공식 이미지에는 헬스체크, 지속성 볼륨, 자동 재시작 기능 포함; 한 번의 클릭으로 간편 배포 가능
웹 인터페이스 Paperless‑ngx에 통합된 반응형 UI로 모델, API 키 설정 및 RAG 채팅 보기 가능

빠른 시작 (Docker)

  1. 컨테이너 생성clusterzx/paperless-ai를 다운로드하고 Paperless‑ngx에서 사용하는 것과 동일한 볼륨을 마운트하여 PDF를 읽을 수 있도록 설정
  2. 설정 – UI 열기, LLM API 키(OpenAI, Ollama 엔드포인트 등) 추가 및 원하는 태그 규칙 설정
  3. 첫 실행 – 설정 저장 후 컨테이너 재시작; 기존 문서 스캔, 임베딩 생성, RAG 인덱스 구축
  4. 사용 – 새 파일은 자동으로 처리됨. 채팅 페이지에 방문하여 전체 아카이브에 대한 자연어 질의 수행

자세한 절차는 설치 위키 를 참조하세요.


개발 및 기여

  • 리포지토리 클론 후 npm install 실행 후 npm run test로 로컬 개발 서버 시작
  • PR 환영합니다. README에 일반적인 포크-브랜치-PR 워크플로우 설명되어 있음
  • 커뮤니티 지원은 GitHub Issues 및 디스코드 서버에서 진행

라이선스 및 지원

  • MIT 라이선스 – 무료로 사용, 수정, 재배포 가능
  • 기여자 모집 중. 선택적 기부는 Patreon/PayPal/Ko‑fi 페이지에서 가능

결론 – Paperless‑AI는 자체 호스팅 문서 아카이브에 LLM 기반 분류, 태그 지정, 의미 검색 기능을 추가하여, 영어로 질문만 하면 PDF에서 정보를 검색할 수 있게 하면서도 데이터는 당신의 통제 하에 유지할 수 있게 해줍니다.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트