bhimrazy/receipt-ocr

An efficient OCR engine for receipt image processing.

解决的问题

简化将收据图像转换为可用数据的过程。提供两种路径:使用 Tesseract OCR 从图像中提取原始文本,或使用大型语言模型(LLMs)提取结构化、机器可读的 JSON 数据(如商户名称、日期和明细项目)。

工作原理

该项目分为两个模块:

  1. 收据 OCR 模块:使用 LLM 提供商(如 OpenAI、Google Gemini 或 Groq)分析收据图像,并将其解析为特定的 JSON 模式。可通过 CLI、Python 库或 FastAPI Web 服务使用。
  2. Tesseract OCR 模块:使用 Tesseract OCR 引擎从图像中提取原始文本,通过 CLI 或基于 Docker 的 API 提供简单的纯文本输出。

适用人群

  • 开发费用跟踪或会计软件的开发者。
  • 需要自动化物理收据数字化的用户。
  • 需要生产就绪的收据处理 REST API 的团队。

主要亮点

  • 多 LLM 支持:兼容 OpenAI、Gemini 和 Groq。
  • 可自定义提取:允许用户定义自己的 JSON 模式以提取所需数据。
  • 灵活部署:可作为本地 Python 包、CLI 工具或部署为 Docker 化的 FastAPI 服务运行。
  • 双模式提取:同时提供原始文本提取(Tesseract)和结构化数据提取(LLM)。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目