breezedeus/Pix2Text
An Open-Source Python3 tool with SMALL models for recognizing layouts, tables, math formulas (LaTeX), and text in images, converting them into Markdown format. A free alternative to Mathpix, empowering seamless conversion of visual content into text-based representations. 80+ languages are supported.
何を解決するか
Pix2Text (P2T) は、Mathpix のオープンソース版として、画像やPDFファイルを構造化されたMarkdown形式に変換するためのPythonツールキットです。特に、数学的式、表、多様なページレイアウトといった複雑なコンテンツを正確に認識・統合する難しさに対処しています。
動作方法
P2Tは、専用のAIモデルのパイプラインを使用して視覚データを処理します:
- レイアウト分析:DocLayout-YOLOなどのモデルを使用して、ページの構造を識別します。
- 数式検出・認識:専用のMFD(数学式検出)およびMFR(数学式認識)モデルを使用して、数式をLaTeX/Markdownに変換します。
- 表認識:視覚的な表をMarkdown形式に変換します。
- テキスト認識:OCRエンジン(英語・中国語用にCnOCR、80以上の言語用にEasyOCR)を使用して、プレーンテキストを抽出します。
- VLM統合:LiteLLMインターフェースを介して、閉鎖型の視覚言語モデル(VLM)をサポートし、表や数式のOCRを実行します。
対象ユーザー
- 手書きまたは印刷された数学ノートや学術論文をデジタル化したい研究者や学生。
- 複雑なドキュメント解析用に無料でオープンソースのOCRツールキットを探している開発者。
- スキャンされたPDFを編集可能なMarkdownファイルに変換したいユーザー。
特徴
- 包括的な解析:1つのワークフローでテキスト、表、数学的式を処理できます。
- 多言語対応:テキスト認識で80以上の言語をサポートしています。
- PDFからMarkdown:スキャンされた画像を含む、完全なPDFファイルをMarkdownに変換可能です。
- 最先端の数式認識:広範なデータセットで訓練された高精度なMFRモデルを使用しています。
- 柔軟なデプロイ:Pythonライブラリ、コマンドラインツール、HTTPサービス、MacOSデスクトップアプリとして利用可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト