Yuliang-Liu/MonkeyOCR
A lightweight LMM-based Document Parsing Model
解决的问题
MonkeyOCR 旨在解决文档解析的复杂性,特别是将 PDF 和图像转换为 Markdown 等结构化格式的挑战。它旨在通过提供一种更精简、高性能的方法来识别文本、公式和表格,从而取代繁琐的多工具流水线以及使用大规模多模态模型进行全页处理的低效方式。
工作原理
该项目采用了 Structure-Recognition-Relation (SRR) 三元组范式。这种方法通过专注于三个核心组件来简化解析过程:识别文档结构、识别结构内的内容,以及确定不同内容块之间的关系。它支持中英文文档,并提供不同的模型规模(例如 1.2B 和 3B 参数)以平衡速度和准确性。
适用对象
该工具面向需要将复杂文档(PDF 或图像)转换为结构化、机器可读文本的开发人员和研究人员,特别是那些处理包含数学公式和表格的多语言(英语和中文)文档的用户。
亮点
- 高性能:在 OmniDocBench 基准测试中优于多种闭源和大型开源 VLM(如 GPT-4o 和 Gemini 2.0-Flash)。
- 灵活部署:支持广泛的 GPU(从 4060 到 H800)并提供 Docker 部署选项。
- 全面的输出:生成处理后的 Markdown 文件、布局 PDF 以及包含块坐标和关系的详细中间 JSON 结果。
- 高效扩展:1.2B 模型在性能损失极小的情况下,比 3B 版本提供了显著的速度提升(约 36%)。
相关
- 项目
- 项目
- 项目
- 项目
- 项目