breezedeus/Pix2Text

An Open-Source Python3 tool with SMALL models for recognizing layouts, tables, math formulas (LaTeX), and text in images, converting them into Markdown format. A free alternative to Mathpix, empowering seamless conversion of visual content into text-based representations. 80+ languages are supported.

解决的问题

Pix2Text (P2T) 是 Mathpix 的开源替代方案,旨在将图像和 PDF 文件转换为结构化的 Markdown 格式。它特别解决了将数学公式、表格和多变的页面布局等复杂内容准确识别并整合到单一数字文档中的难题。

工作原理

P2T 使用一系列专用 AI 模型处理视觉数据:

  • 布局分析:使用 DocLayout-YOLO 等模型识别页面结构。
  • 公式检测与识别:使用专用的 MFD(数学公式检测)和 MFR(数学公式识别)模型识别并转换公式为 LaTeX/Markdown。
  • 表格识别:将视觉表格转换为 Markdown 格式。
  • 文本识别:使用 OCR 引擎(CnOCR 用于英文/中文,EasyOCR 用于 80 多种其他语言)提取纯文本。
  • VLM 集成:通过 LiteLLM 接口支持闭源视觉语言模型(VLM),用于表格和公式 OCR。

适用人群

  • 需要将手写或印刷的数学笔记和学术论文数字化的 研究人员和学生
  • 寻找免费开源 OCR 工具包用于复杂文档解析的 开发者
  • 希望将扫描的 PDF 转换为可编辑 Markdown 文件的 用户

核心亮点

  • 全面解析:在一个工作流中处理文本、表格和数学公式。
  • 多语言支持:支持超过 80 种语言的文本识别。
  • PDF 转 Markdown:可将整个 PDF 文件(包括扫描图像)转换为 Markdown。
  • 顶尖公式识别:采用在大规模数据集上训练的高精度 MFR 模型。
  • 灵活部署:提供 Python 库、命令行工具、HTTP 服务和 MacOS 桌面应用程序。

相关

  • 项目
  • 项目
  • 项目
  • 项目