opendatalab/MinerU
Transforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.
What it solves
MinerU 是一个高精度的文档解析引擎,旨在将复杂的文档——包括 PDF、DOCX、PPTX、XLSX、图像和网页——转换为结构化的 Markdown 或 JSON。它解决了从具有复杂布局的文档中提取高质量、结构化数据的问题,例如多栏布局、扫描文档、手写内容和跨页表格,这对于 LLM、RAG 和 Agent 工作流至关重要。
How it works
该引擎采用双引擎方法,结合了视觉语言模型 (VLM) 和光学字符识别 (OCR) 以支持 109 种语言。它提供三种推理后端:
- pipeline: 一个快速、稳定、兼容 CPU/GPU 的后端,可避免幻觉。
- vlm-engine: 一个高精度的后端,支持 vLLM、LMDeploy 和 mlx 生态系统。
- hybrid-engine: 一个在精度与原生文本提取之间取得平衡的后端,以最大限度地减少幻觉。
Who it’s for
- Developers 正在构建 RAG 框架或 AI agents,需要从各种文档格式中获取干净、结构化的数据。
- Enterprise users 需要在各种 AI 芯片上进行私有、完全离线的部署(例如:Ascend、Moore Threads)。
- No-code users 偏好使用网页版、webui、桌面客户端或 Gradio WebUI。
Highlights
- Multi-format support: 原生解析 PDF、DOCX、PPTX、XLSX 和图像。
- Complex layout handling: 精确地重建公式(转换为 LaTeX)、表格(转换为 HTML)以及符合人类阅读顺序的内容,并自动移除页眉/页脚。
- Broad integration: 与 LangChain、LlamaIndex、RAGFlow、Dify 和 FastGPT 原生集成,并支持 Cursor 和 Claude Desktop 的 MCP server。
- Scalable infrastructure: 支持多线程并发推理,通过
mineru-router进行多-GPU 部署,以及针对超长文档的进行滑动窗口机制。
相关
- 项目
- 项目
- 项目
- 项目
- 项目