kotaro-kinoshita/yomitoku
YomiTokuはAIを活用した日本語文書解析エンジンを提供するPythonパッケージです。 Yomitoku is an AI-powered document image analysis package designed specifically for the Japanese language.
何を解決するか
YomiToku は日本語のテキストとレイアウトに特化した Document AI エンジンです。画像化された文書から構造化情報を抽出する問題を解決し、縦書き、手書きテキスト、複雑な表構造といった日本語特有の課題を、一般的な OCR ツールが苦手とする点を克服します。
動作方法
このプロジェクトは、文書解析のフルパイプラインを実行するために4つのカスタムトレーニング済みAIモデルを使用しています:
- テキスト検出:画像内のテキストの位置を特定します。
- テキスト認識:検出されたテキスト領域を文字列に変換し、7,000以上の日本語文字をサポートします。
- レイアウト解析:段落、図、画像などの文書の意味的構造を識別します。
- 表構造認識:表のグリッドとセル構造を分析し、データ間の意味的関係を維持します。
Markdown、HTML、JSON、CSV、検索可能なPDFなど、複数の出力形式を提供します。また、CPUベースの高速推論を可能にする「ライト」モードも搭載しています。
対象ユーザー
- 日本語OCRおよびレイアウト解析をアプリケーションに統合したい 開発者。
- 日本語文書のデジタル化に取り組む 研究者。
- フォーム、レポート、請求書からのデータ抽出を自動化したい 企業(Table Semantic Parser and Extractor を通じて)。
特徴
- 日本語特化:縦書きおよび手書き日本語テキストに対して高い精度を実現。
- 構造化抽出:表を構造化されたJSONやCSVに変換しつつ、読み順を保持。
- 柔軟な抽出:固定フォーム向けのルールベース抽出と、非構造化文書向けのLLMベース抽出を、YAMLスキーマで統合。
- ハードウェア効率:8GB VRAM未満のGPUまたは軽量モデルによるCPUで動作可能。
- プライバシー最優先のデモ:WebAssembly/WebGPUを介してローカルで推論を行うブラウザベースのデモ(YomiToku Studio)を提供。画像はサーバーにアップロードされない。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト