opendatalab/MinerU

Transforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.

What it solves

MinerU는 PDF, DOCX, PPTX, XLSX, 이미지 및 웹 페이지를 포함한 복잡한 문서를 구조화된 Markdown 또는 JSON으로 변환하도록 설계된 고정밀 문서 파싱 엔진입니다. 다중 열 레이아웃, 스캔된 문서, 필기체, 페이지를 가로지르는 표 등 복잡한 레이아웃을 가진 문서에서 고품질의 구조화된 데이터를 추출하는 문제를 해결하며, 이는 LLM, RAG 및 Agent 워크플로우에 필수적입니다.

How it works

이 엔진은 Vision Language Models (VLM)와 Optical Character Recognition (OCR)을 결합한 듀얼 엔진 방식을 사용하여 109개 언어를 지원합니다. 세 가지 추론 백엔드를 제공합니다:

  • pipeline: 환각 현상을 방지하는 빠르고 안정적인 CPU/GPU 호환 백엔드.
  • vlm-engine: vLLM, LMDeploy 및 mlx 생태계를 지원하는 고정밀 백엔드.
  • hybrid-engine: 고정밀도와 네이티브 텍스트 추출 사이의 균형을 맞추어 환각 현상을 최소화합니다.

Who it’s for

  • Developers 다양한 문서 형식에서 깨끗하고 구조화된 데이터가 필요한 RAG 프레임워크 또는 AI 에이전트를 구축하는 개발자.
  • Enterprise users 다양한 AI 칩(예: Ascend, Moore Threads)에서 프라이빗하고 완전한 오프라인 배포가 필요한 기업 사용자.
  • No-code users 웹 버전, 데스크톱 클라이언트 또는 Gradio WebUI 사용을 선호하는 사용자.

Highlights

  • Multi-format support: PDF, DOCX, PPTX, XLSX 및 이미지에 대한 네이티브 파싱.
  • Complex layout handling: 수식(LaTeX로), 표(HTML로) 및 자동 헤더/푸터 제거를 포함한 인간의 읽기 순서의 정확한 재구성.
  • Broad integration: LangChain, LlamaIndex, RAGFlow, Dify 및 FastGPT와의 네이티브 통합, 그리고 Cursor 및 Claude Desktop을 위한 MCP server 지원.
  • Scalable infrastructure: 멀티스레드 병렬 추론, mineru-router를 통한 멀티 GPU 배포, 그리고 초장문 문서를 위한 슬라이딩 윈도우 메커니즘 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트