arcships/light-ocr
Fast, offline OCR for Node.js & C++. PP-OCRv6 with Core ML / WebGPU hardware acceleration — recognize text in images with confidence scores & coordinates. npm: @arcships/light-ocr
해결하는 문제
light-ocr는 Node.js 및 C++ 애플리케이션을 위한 빠르고 오프라인의 광학 문자 인식(OCR) 솔루션을 제공합니다. 외부 API 호출이나 복잡한 시스템 수준 종속성을 필요로 하지 않으며, 로컬 머신에서 이미지(JPEG, PNG) 및 PDF의 텍스트를 직접 인식할 수 있습니다.
작동 방식
이 프로젝트는 기본적으로 PP-OCRv6 Small 모델을 사용하고, 문서 렌더링을 위해 PDFium을 통합합니다. OCR 런타임, 모델, 필요한 폰트를 포함한 단일 npm 패키지로 배포되어 설치 후 다운로드나 컴파일러가 필요하지 않습니다.
성능 최적화를 위해 자동으로 하드웨어 가속을 감지합니다: Apple Silicon(macOS 15+)에서는 Core ML, Linux 및 Windows에서는 WebGPU(Vulkan 또는 D3D12 경유), 그렇지 않으면 CPU로 백업합니다.
대상 사용자
- Node.js 개발자: 로컬 텍스트 인식이 필요한 CLI, 데스크톱 소프트웨어, 서버 사이드 앱을 개발하는 사람.
- C++ 개발자: OCR 통합을 위한 네이티브 정적 라이브러리가 필요한 사람.
- AI 에이전트: 이 프로젝트는 '에이전트 기술'을 포함하여, 영수증 추출 또는 검증과 같은 작업에서 다중 모달 모델보다 결정론적 OCR을 사용할 때를 AI 에이전트가 판단하는 데 도움을 줍니다.
주요 특징
- 제로 구성: npm install 한 번으로 모든 것(모델, 런타임, PDF 렌더러, 폰트)이 제공되며, 추가 다운로드 없음.
- 로컬 및 개인 정보 보호: 모든 처리는 디바이스에서 이루어져 데이터 프라이버시 보장.
- 하드웨어 가속 지원: Core ML 및 WebGPU의 네이티브 지원으로 CPU 실행보다 훨씬 빠른 성능 제공.
- 유연한 입력 형식: PDF, JPEG, PNG, 그리고 원시 픽셀 버퍼(GRAY8, RGB8, BGR8, RGBA8)를 지원.
- 다단계 모델: 안정적인 Small, 초경량 Tiny, 품질 중심의 Medium 모델 옵션 제공.
- 타일 모드: 고해상도 이미지에서 작은 밀집 텍스트를 유지하기 위한 선택적 모드.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트