opendatalab/MinerU

Transforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.

What it solves

MinerU 是一个高精度的文档解析引擎,旨在将复杂的文档——包括 PDF、DOCX、PPTX、XLSX、图像和网页——转换为结构化的 Markdown 或 JSON。它解决了从具有复杂布局的文档中提取高质量、结构化数据的问题,例如多栏布局、扫描文档、手写内容和跨页表格,这对于 LLM、RAG 和 Agent 工作流至关重要。

How it works

该引擎采用双引擎方法,结合了视觉语言模型 (VLM) 和光学字符识别 (OCR) 以支持 109 种语言。它提供三种推理后端:

  • pipeline: 一个快速、稳定、兼容 CPU/GPU 的后端,可避免幻觉。
  • vlm-engine: 一个高精度的后端,支持 vLLM、LMDeploy 和 mlx 生态系统。
  • hybrid-engine: 一个在精度与原生文本提取之间取得平衡的后端,以最大限度地减少幻觉。

Who it’s for

  • Developers 正在构建 RAG 框架或 AI agents,需要从各种文档格式中获取干净、结构化的数据。
  • Enterprise users 需要在各种 AI 芯片上进行私有、完全离线的部署(例如:Ascend、Moore Threads)。
  • No-code users 偏好使用网页版、webui、桌面客户端或 Gradio WebUI。

Highlights

  • Multi-format support: 原生解析 PDF、DOCX、PPTX、XLSX 和图像。
  • Complex layout handling: 精确地重建公式(转换为 LaTeX)、表格(转换为 HTML)以及符合人类阅读顺序的内容,并自动移除页眉/页脚。
  • Broad integration: 与 LangChain、LlamaIndex、RAGFlow、Dify 和 FastGPT 原生集成,并支持 Cursor 和 Claude Desktop 的 MCP server。
  • Scalable infrastructure: 支持多线程并发推理,通过 mineru-router 进行多-GPU 部署,以及针对超长文档的进行滑动窗口机制。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目