opendatalab/MinerU
Transforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.
What it solves
MinerU 是一個高精度的文件解析引擎,旨在將複雜的文件——包括 PDF、DOCX、PPTX、XLSX、圖像和網頁——轉換為結構化的 Markdown 或 JSON。它解決了從具有複雜佈局的文件中提取高品質、結構化數據的問題,例如多欄位佈局、掃描文件、手寫內容和跨頁表格,這對於 LLM、RAG 和 Agent 工作流至關重要。
How it works
該引擎採用雙引擎方法,結合了視覺語言模型 (VLM) 和光學字符識別 (OCR) 以支持 109 種語言。它提供三種推理後端:
- pipeline: 一個快速、穩定、兼容 CPU/GPU 的後端,可避免幻覺。
- vlm-engine: 一個高精度的後端,支持 vLLM、LMDeploy 和 mlx 生態系統。
- hybrid-engine: 在高精度和原生文本提取之間取得平衡,以最大限度地減少幻覺。
Who it’s for
- Developers 正在構建 RAG 框架或 AI agents,需要從各種文件格式中獲取乾淨、結構化的數據。
- Enterprise users 需要在各種 AI 芯片上進行私有、完全離線的部署(例如:Ascend、Moore Threads)。
- No-code users 偏好使用網頁版、桌面客戶端或 Gradio WebUI。
Highlights
- Multi-format support: 原生解析 PDF、DOCX、PPTX、XLSX 和圖像。
- Complex layout handling: 精確地重建構公式(轉換為 LaTeX)、表格(轉換為 HTML)以及符合人類閱讀順序的內容,並自動移除標題/頁腳。
- Broad integration: 與 LangChain、LlamaIndex、RAGFlow、Dify 和 FastGPT 原生集成,並支持 Cursor 和 Claude Desktop 的 MCP server。
- Scalable infrastructure: 支持多線程併發推理,通過
mineru-router進行多 GPU 部署,以及針對超長文件的滑動窗口機制。"},
相關
- 專案
- 專案
- 專案
- 專案
- 專案