kotaro-kinoshita/yomitoku

YomiTokuはAIを活用した日本語文書解析エンジンを提供するPythonパッケージです。 Yomitoku is an AI-powered document image analysis package designed specifically for the Japanese language.

何を解決するか

YomiToku は日本語のテキストとレイアウトに特化した Document AI エンジンです。画像化された文書から構造化情報を抽出する問題を解決し、縦書き、手書きテキスト、複雑な表構造といった日本語特有の課題を、一般的な OCR ツールが苦手とする点を克服します。

動作方法

このプロジェクトは、文書解析のフルパイプラインを実行するために4つのカスタムトレーニング済みAIモデルを使用しています:

  1. テキスト検出:画像内のテキストの位置を特定します。
  2. テキスト認識:検出されたテキスト領域を文字列に変換し、7,000以上の日本語文字をサポートします。
  3. レイアウト解析:段落、図、画像などの文書の意味的構造を識別します。
  4. 表構造認識:表のグリッドとセル構造を分析し、データ間の意味的関係を維持します。

Markdown、HTML、JSON、CSV、検索可能なPDFなど、複数の出力形式を提供します。また、CPUベースの高速推論を可能にする「ライト」モードも搭載しています。

対象ユーザー

  • 日本語OCRおよびレイアウト解析をアプリケーションに統合したい 開発者
  • 日本語文書のデジタル化に取り組む 研究者
  • フォーム、レポート、請求書からのデータ抽出を自動化したい 企業(Table Semantic Parser and Extractor を通じて)。

特徴

  • 日本語特化:縦書きおよび手書き日本語テキストに対して高い精度を実現。
  • 構造化抽出:表を構造化されたJSONやCSVに変換しつつ、読み順を保持。
  • 柔軟な抽出:固定フォーム向けのルールベース抽出と、非構造化文書向けのLLMベース抽出を、YAMLスキーマで統合。
  • ハードウェア効率:8GB VRAM未満のGPUまたは軽量モデルによるCPUで動作可能。
  • プライバシー最優先のデモ:WebAssembly/WebGPUを介してローカルで推論を行うブラウザベースのデモ(YomiToku Studio)を提供。画像はサーバーにアップロードされない。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト