privatenumber/mac-ocr

macOS CLI for OCR and searchable PDFs using Apple's Vision framework

해결하는 문제

mac-ocr는 macOS에서 로컬 및 개인 정보 보호를 위한 OCR(광학 문자 인식)을 가능하게 하는 명령줄 도구이자 Node.js API입니다. 데이터를 외부 서버에 업로드하지 않고도 이미지나 PDF에서 텍스트를 추출할 수 있어, AI 에이전트와 사용자 모두에게 클라우드 기반 비전 토큰의 무료이고 프라이버시 중심의 대안을 제공합니다.

작동 방식

이 도구는 Apple의 Vision 프레임워크(VNRecognizeTextRequestRecognizeDocumentsRequest)를 활용하는 네이티브 Swift 바이너리입니다. 이미지와 PDF는 디바이스 내에서 로컬로 처리됩니다. 검색 가능한 PDF를 생성할 때는 Core Graphics와 Core Text를 사용하여 Vision 프레임워크가 감지한 위치에 정확히 텍스트 레이어를 투명하게 덧씌웁니다.

대상 사용자

  • 개발자: 멀티모달 LLM을 사용하는 대신 로컬에서 OCR을 실행함으로써 비용을 절감하고 싶은 AI 에이전트 개발자.
  • macOS 사용자: 스캔된 문서나 이미지를 검색 가능하고 선택 가능한 PDF 또는 일반 텍스트/JSON 파일로 변환하고 싶은 사용자.
  • Node.js 개발자: 타입 지정된 API를 통해 애플리케이션에 로컬 OCR 기능을 통합하고 싶은 개발자.

주요 기능

  • 프라이버시 우선: 데이터 업로드 없이 디바이스 내에서 완전히 작동.
  • 검색 가능한 PDF: 이미지나 스캔된 PDF를 선택 가능한 텍스트 레이어가 있는 PDF로 변환.
  • 구조화된 데이터: 파라그래프, 테이블, 목록 추출 지원 (macOS 26 이상).
  • 유연한 출력 형식: 일반 텍스트, JSON, JSONL(대규모 문서 스트리밍 지원)을 지원.
  • 분할 OCR: 대규모 페이지를 재귀적으로 분할하는 고급 전략으로, 일반적인 전체 페이지 처리에서 놓칠 수 있는 작은 텍스트를 복구 가능.
  • 크로스패키지 지원: Xcode나 Swift 툴체인 없이도 설치 가능한 npm 패키지로 배포되며, 사전 빌드된 바이너리 포함.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트