bhimrazy/receipt-ocr
An efficient OCR engine for receipt image processing.
何を解決するか
レシート画像を扱いやすいデータに変換するプロセスを簡素化します。2つの方法を提供します:Tesseract OCRを使用して画像から生テキストを抽出する方法と、大規模言語モデル(LLM)を使用して構造化された機械可読JSONデータ(店名、日付、明細項目など)を抽出する方法です。
動作方法
このプロジェクトは2つのモジュールに分かれています:
- レシートOCRモジュール:OpenAI、Google Gemini、GroqなどのLLMプロバイダーを使用してレシート画像を分析し、特定のJSONスキーマにパースします。CLI、Pythonライブラリ、またはFastAPIウェブサービスとして利用可能です。
- Tesseract OCRモジュール:Tesseract OCRエンジンを使用して画像から生テキストを抽出し、CLIまたはDockerベースのAPIを通じてシンプルなテキスト出力を提供します。
対象ユーザー
- 経費追跡や会計ソフトを開発している開発者。
- 物理的なレシートのデジタル化を自動化したいユーザー。
- レシート処理用のプロダクション対応REST APIを必要とするチーム。
特徴
- 複数のLLM対応:OpenAI、Gemini、Groqと互換性があります。
- カスタマイズ可能な抽出:ユーザーが抽出したいデータ用の独自のJSONスキーマを定義できます。
- 柔軟なデプロイ:ローカルのPythonパッケージ、CLIツール、またはDocker化されたFastAPIサービスとして実行可能です。
- 二重抽出モード:生テキスト抽出(Tesseract)と構造化データ抽出(LLM)の両方を提供します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト