breezedeus/Pix2Text
An Open-Source Python3 tool with SMALL models for recognizing layouts, tables, math formulas (LaTeX), and text in images, converting them into Markdown format. A free alternative to Mathpix, empowering seamless conversion of visual content into text-based representations. 80+ languages are supported.
解決的問題
Pix2Text (P2T) 是 Mathpix 的開源替代方案,旨在將影像與 PDF 檔案轉換為結構化的 Markdown 格式。它特別解決了將數學公式、表格與多變的頁面版面等複雜內容準確識別並整合至單一數位文件的難題。
工作原理
P2T 使用一系列專用 AI 模型處理視覺資料:
- 版面分析:使用 DocLayout-YOLO 等模型識別頁面結構。
- 公式檢測與識別:使用專用的 MFD(數學公式檢測)與 MFR(數學公式識別)模型,識別並轉換公式為 LaTeX/Markdown。
- 表格識別:將視覺表格轉換為 Markdown 格式。
- 文字識別:使用 OCR 引擎(CnOCR 用於英文/中文,EasyOCR 用於 80 多種其他語言)提取純文字。
- VLM 整合:透過 LiteLLM 接口支援封閉式視覺語言模型(VLM),用於表格與公式 OCR。
適用對象
- 需要將手寫或印刷的數學筆記與學術論文數位化的 研究人員與學生。
- 尋找免費開源 OCR 工具包用於複雜文件解析的 開發者。
- 希望將掃描的 PDF 轉換為可編輯 Markdown 檔案的 使用者。
核心亮點
- 全面解析:在一個工作流程中處理文字、表格與數學公式。
- 多語言支援:支援超過 80 種語言的文字識別。
- PDF 轉 Markdown:可將整個 PDF 檔案(包含掃描影像)轉換為 Markdown。
- 頂尖公式識別:採用在大型資料集上訓練的高精度 MFR 模型。
- 彈性部署:提供 Python 套件、命令列工具、HTTP 服務與 MacOS 桌面應用程式。
相關
- 專案
- 專案
- 專案
- 專案