bhimrazy/receipt-ocr
An efficient OCR engine for receipt image processing.
해결하는 문제
레시트 이미지를 사용 가능한 데이터로 변환하는 과정을 간소화합니다. 두 가지 경로를 제공합니다: Tesseract OCR을 사용해 이미지에서 원시 텍스트를 추출하거나, 대규모 언어 모델(LLM)을 사용해 구조화된 기계 판독 가능한 JSON 데이터(예: 상점 이름, 날짜, 항목 목록 등)를 추출합니다.
작동 방식
이 프로젝트는 두 가지 모듈로 나뉩니다:
- 레시트 OCR 모듈: OpenAI, Google Gemini, Groq 등의 LLM 제공업체를 사용해 레시트 이미지를 분석하고 특정 JSON 스키마로 파싱합니다. CLI, Python 라이브러리, 또는 FastAPI 웹 서비스로 사용할 수 있습니다.
- Tesseract OCR 모듈: Tesseract OCR 엔진을 사용해 이미지에서 원시 텍스트를 추출하며, CLI 또는 Docker 기반 API를 통해 간단한 텍스트 출력을 제공합니다.
대상 사용자
- 경비 추적 또는 회계 소프트웨어를 개발하는 개발자.
- 물리적 레시트의 디지털화를 자동화하고자 하는 사용자.
- 레시트 처리를 위한 프로덕션 준비된 REST API가 필요한 팀.
주요 특징
- 다중 LLM 지원: OpenAI, Gemini, Groq와 호환됩니다.
- 사용자 정의 추출: 원하는 데이터를 위한 사용자 정의 JSON 스키마를 정의할 수 있습니다.
- 유연한 배포: 로컬 Python 패키지, CLI 도구, 또는 Docker화된 FastAPI 서비스로 실행할 수 있습니다.
- 이중 추출 모드: 원시 텍스트 추출(Tesseract)과 구조화된 데이터 추출(LLM)을 모두 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트