opendatalab/MinerU
Transforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.
What it solves
MinerU는 PDF, DOCX, PPTX, XLSX, 이미지 및 웹 페이지를 포함한 복잡한 문서를 구조화된 Markdown 또는 JSON으로 변환하도록 설계된 고정밀 문서 파싱 엔진입니다. 다중 열 레이아웃, 스캔된 문서, 필기체, 페이지를 가로지르는 표 등 복잡한 레이아웃을 가진 문서에서 고품질의 구조화된 데이터를 추출하는 문제를 해결하며, 이는 LLM, RAG 및 Agent 워크플로우에 필수적입니다.
How it works
이 엔진은 Vision Language Models (VLM)와 Optical Character Recognition (OCR)을 결합한 듀얼 엔진 방식을 사용하여 109개 언어를 지원합니다. 세 가지 추론 백엔드를 제공합니다:
- pipeline: 환각 현상을 방지하는 빠르고 안정적인 CPU/GPU 호환 백엔드.
- vlm-engine: vLLM, LMDeploy 및 mlx 생태계를 지원하는 고정밀 백엔드.
- hybrid-engine: 고정밀도와 네이티브 텍스트 추출 사이의 균형을 맞추어 환각 현상을 최소화합니다.
Who it’s for
- Developers 다양한 문서 형식에서 깨끗하고 구조화된 데이터가 필요한 RAG 프레임워크 또는 AI 에이전트를 구축하는 개발자.
- Enterprise users 다양한 AI 칩(예: Ascend, Moore Threads)에서 프라이빗하고 완전한 오프라인 배포가 필요한 기업 사용자.
- No-code users 웹 버전, 데스크톱 클라이언트 또는 Gradio WebUI 사용을 선호하는 사용자.
Highlights
- Multi-format support: PDF, DOCX, PPTX, XLSX 및 이미지에 대한 네이티브 파싱.
- Complex layout handling: 수식(LaTeX로), 표(HTML로) 및 자동 헤더/푸터 제거를 포함한 인간의 읽기 순서의 정확한 재구성.
- Broad integration: LangChain, LlamaIndex, RAGFlow, Dify 및 FastGPT와의 네이티브 통합, 그리고 Cursor 및 Claude Desktop을 위한 MCP server 지원.
- Scalable infrastructure: 멀티스레드 병렬 추론,
mineru-router를 통한 멀티 GPU 배포, 그리고 초장문 문서를 위한 슬라이딩 윈도우 메커니즘 지원.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트