bhimrazy/receipt-ocr

An efficient OCR engine for receipt image processing.

何を解決するか

レシート画像を扱いやすいデータに変換するプロセスを簡素化します。2つの方法を提供します:Tesseract OCRを使用して画像から生テキストを抽出する方法と、大規模言語モデル(LLM)を使用して構造化された機械可読JSONデータ(店名、日付、明細項目など)を抽出する方法です。

動作方法

このプロジェクトは2つのモジュールに分かれています:

  1. レシートOCRモジュール:OpenAI、Google Gemini、GroqなどのLLMプロバイダーを使用してレシート画像を分析し、特定のJSONスキーマにパースします。CLI、Pythonライブラリ、またはFastAPIウェブサービスとして利用可能です。
  2. Tesseract OCRモジュール:Tesseract OCRエンジンを使用して画像から生テキストを抽出し、CLIまたはDockerベースのAPIを通じてシンプルなテキスト出力を提供します。

対象ユーザー

  • 経費追跡や会計ソフトを開発している開発者。
  • 物理的なレシートのデジタル化を自動化したいユーザー。
  • レシート処理用のプロダクション対応REST APIを必要とするチーム。

特徴

  • 複数のLLM対応:OpenAI、Gemini、Groqと互換性があります。
  • カスタマイズ可能な抽出:ユーザーが抽出したいデータ用の独自のJSONスキーマを定義できます。
  • 柔軟なデプロイ:ローカルのPythonパッケージ、CLIツール、またはDocker化されたFastAPIサービスとして実行可能です。
  • 二重抽出モード:生テキスト抽出(Tesseract)と構造化データ抽出(LLM)の両方を提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト