bhimrazy/receipt-ocr

An efficient OCR engine for receipt image processing.

解決的問題

簡化將收據影像轉換為可用資料的流程。提供兩種途徑:使用 Tesseract OCR 從影像中提取原始文字,或使用大型語言模型(LLMs)提取結構化、機器可讀的 JSON 資料(例如商家名稱、日期和明細項目)。

如何運作

此專案分為兩個模組:

  1. 收據 OCR 模組:使用 LLM 提供者(如 OpenAI、Google Gemini 或 Groq)分析收據影像,並解析為特定的 JSON 模式。可透過 CLI、Python 套件或 FastAPI 網路服務使用。
  2. Tesseract OCR 模組:使用 Tesseract OCR 引擎從影像中提取原始文字,透過 CLI 或基於 Docker 的 API 提供簡單的文字輸出。

適用對象

  • 開發費用追蹤或會計軟體的開發者。
  • 需要自動化物理收據數位化的使用者。
  • 需要生產就緒的收據處理 REST API 的團隊。

主要特色

  • 多 LLM 支援:相容 OpenAI、Gemini 和 Groq。
  • 可自訂提取:允許使用者定義自己的 JSON 模式以提取所需資料。
  • 彈性部署:可作為本地 Python 套件、CLI 工具,或部署為 Docker 化的 FastAPI 服務運行。
  • 雙模式提取:同時提供原始文字提取(Tesseract)與結構化資料提取(LLM)。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案