opendatalab/MinerU

Transforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.

What it solves

MinerU 是一個高精度的文件解析引擎,旨在將複雜的文件——包括 PDF、DOCX、PPTX、XLSX、圖像和網頁——轉換為結構化的 Markdown 或 JSON。它解決了從具有複雜佈局的文件中提取高品質、結構化數據的問題,例如多欄位佈局、掃描文件、手寫內容和跨頁表格,這對於 LLM、RAG 和 Agent 工作流至關重要。

How it works

該引擎採用雙引擎方法,結合了視覺語言模型 (VLM) 和光學字符識別 (OCR) 以支持 109 種語言。它提供三種推理後端:

  • pipeline: 一個快速、穩定、兼容 CPU/GPU 的後端,可避免幻覺。
  • vlm-engine: 一個高精度的後端,支持 vLLM、LMDeploy 和 mlx 生態系統。
  • hybrid-engine: 在高精度和原生文本提取之間取得平衡,以最大限度地減少幻覺。

Who it’s for

  • Developers 正在構建 RAG 框架或 AI agents,需要從各種文件格式中獲取乾淨、結構化的數據。
  • Enterprise users 需要在各種 AI 芯片上進行私有、完全離線的部署(例如:Ascend、Moore Threads)。
  • No-code users 偏好使用網頁版、桌面客戶端或 Gradio WebUI。

Highlights

  • Multi-format support: 原生解析 PDF、DOCX、PPTX、XLSX 和圖像。
  • Complex layout handling: 精確地重建構公式(轉換為 LaTeX)、表格(轉換為 HTML)以及符合人類閱讀順序的內容,並自動移除標題/頁腳。
  • Broad integration: 與 LangChain、LlamaIndex、RAGFlow、Dify 和 FastGPT 原生集成,並支持 Cursor 和 Claude Desktop 的 MCP server。
  • Scalable infrastructure: 支持多線程併發推理,通過 mineru-router 進行多 GPU 部署,以及針對超長文件的滑動窗口機制。"},

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案