mindee/doctr

docTR (Document Text Recognition) - a seamless, high-performing & accessible library for OCR-related tasks powered by Deep Learning. Ongoing development and maintenance by t2k.

解决的问题

docTR 提供了一种无缝且易于访问的方式,用于对文档进行光学字符识别(OCR)。它允许用户通过定位 PDF、图像或网页中的文字位置并识别字符,来解析文本信息,从而将视觉文档数据高效转换为机器可读的文本。

工作原理

该库采用两阶段方法实现端到端 OCR:

  1. 文本检测:使用 DBNet、LinkNet 或 FAST 等架构定位页面上的文字位置。
  2. 文本识别:使用 CRNN、SAR、MASTER、ViTSTR、PARSeq 或 VIPTR 等架构识别这些定位文字中的字符。

此外,还提供一个 KIE(关键信息提取)预测器,用于检测特定类别的信息(如日期和地址),以及一个 布局检测模型,用于识别标题、表格和页脚等区域。

适用人群

专为希望将高质量 OCR 和文档分析功能集成到其应用程序中的开发者和组织设计,适用于从简单的脚本分析到使用 FastAPI 的完整 API 部署等各种场景。

主要亮点

  • 灵活的架构:支持多种预训练模型用于检测和识别。
  • 多样的输入:可处理 PDF、图像和 URL。
  • 文档结构:返回嵌套对象结构(Page、Block、Line、Word),可导出为 JSON。
  • 布局与表格分析:支持检测文档布局区域和表格结构。
  • 部署就绪:提供 Docker 镜像和 FastAPI 模板,便于快速集成 API。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目