datalab-to/marker

Convert PDF to markdown + JSON quickly with high accuracy

解决的问题

Marker 可以将复杂的文档(包括 PDF、图像、PPTX、DOCX、XLSX、HTML 和 EPUB 文件)转换为干净、结构化的格式,如 Markdown、JSON、HTML 和分块(chunks)。它专门解决从包含表格、数学公式、多栏布局和扫描页面的文档中提取结构化数据的难题,同时去除页眉和页脚等不需要的杂质。

工作原理

Marker 在文档智能方面采用混合方法。它使用名为 Surya 的专用 VLM(视觉语言模型)进行布局检测和 OCR。根据配置,它以两种主要模式运行:

  • 平衡模式 (Balanced Mode):针对 GPU 进行了优化,在必要时使用 VLM 进行布局检测和全页 OCR,以确保最高质量。
  • 快速模式 (Fast Mode):针对 CPU 进行了优化,优先考虑文本层,并仅在处理公式和修复乱码文本时极少量使用 VLM。

为了获得最高准确度,用户可以通过传递 LLM(如 Gemini、Claude 或 OpenAI)来启用“混合模式 (Hybrid Mode)”,以优化输出、合并跨页表格并改进表单提取。

适用对象

Marker 专为开发人员和数据科学家设计,他们需要将大量文档转换为多种语言的机器可读格式,用于下游 AI 任务,如 RAG(检索增强生成)或数据集创建。

亮点

  • 多格式支持:处理 PDF、图像、Office 文档和 EPUB。
  • 高质量提取:准确格式化表格、行内数学公式 (LaTeX) 和代码块。
  • 灵活部署:使用 vLLM 或 llama.cpp 等后端,在 GPU、CPU 或 Apple Silicon (MPS) 上运行。
  • LLM 集成:可选的基于 LLM 的增强功能,用于提高复杂格式的准确度。
  • 可扩展性:允许用户提供自定义格式逻辑和处理器。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目