datalab-to/marker
Convert PDF to markdown + JSON quickly with high accuracy
解决的问题
Marker 可以将复杂的文档(包括 PDF、图像、PPTX、DOCX、XLSX、HTML 和 EPUB 文件)转换为干净、结构化的格式,如 Markdown、JSON、HTML 和分块(chunks)。它专门解决从包含表格、数学公式、多栏布局和扫描页面的文档中提取结构化数据的难题,同时去除页眉和页脚等不需要的杂质。
工作原理
Marker 在文档智能方面采用混合方法。它使用名为 Surya 的专用 VLM(视觉语言模型)进行布局检测和 OCR。根据配置,它以两种主要模式运行:
- 平衡模式 (Balanced Mode):针对 GPU 进行了优化,在必要时使用 VLM 进行布局检测和全页 OCR,以确保最高质量。
- 快速模式 (Fast Mode):针对 CPU 进行了优化,优先考虑文本层,并仅在处理公式和修复乱码文本时极少量使用 VLM。
为了获得最高准确度,用户可以通过传递 LLM(如 Gemini、Claude 或 OpenAI)来启用“混合模式 (Hybrid Mode)”,以优化输出、合并跨页表格并改进表单提取。
适用对象
Marker 专为开发人员和数据科学家设计,他们需要将大量文档转换为多种语言的机器可读格式,用于下游 AI 任务,如 RAG(检索增强生成)或数据集创建。
亮点
- 多格式支持:处理 PDF、图像、Office 文档和 EPUB。
- 高质量提取:准确格式化表格、行内数学公式 (LaTeX) 和代码块。
- 灵活部署:使用 vLLM 或 llama.cpp 等后端,在 GPU、CPU 或 Apple Silicon (MPS) 上运行。
- LLM 集成:可选的基于 LLM 的增强功能,用于提高复杂格式的准确度。
- 可扩展性:允许用户提供自定义格式逻辑和处理器。
相关
- 项目
- 项目
- 项目
- 项目
- 项目