opendatalab/MinerU

Transforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.

What it solves

MinerUは、PDF、DOCX、PPTX、XLSX、画像、およびウェブページを含む複雑なドキュメントを、構造化されたMarkdownまたはJSONに変換するために設計された高精度なドキュメント解析エンジンです。マルチカラムレイアウト、スキャンされたドキュメント、手書き、およびページをまたぐテーブルなど、複雑なレイアウトを持つドキュメントから高品質で構造化されたデータを抽出する問題を解決します。これは、LLM、RAG、および Agent ワークフローに不可欠です。

How it works

このエンジンは、Vision Language Models (VLM) と Optical Character Recognition (OCR) を組み合わせたデュアルエンジン方式を採用し、109言語をサポートしています。3つの推論バックエンドを提供します:

  • pipeline: 高速で安定しており、CPU/GPU両対応の、ハルシネーション(幻覚)を回避するバックエンド。
  • vlm-engine: vLLM、LMDeploy、および mlx エコシステムをサポートする高精度バックエンド。
  • hybrid-engine: 高精度とネイティブテキスト抽出のバランスをとり、ハルシネーションを最小限に抑えます。

Who it’s for

  • Developers RAGフレームワークやAIエージェントを構築しており、クリーンで構造化されたデータが必要な開発者。
  • Enterprise users さまざまなAIチップ(例:Ascend、Moore Threads)上で、プライベートで完全オフラインのデプロイメントが必要な企業ユーザー。 、
  • No-code users ウェブ版、デスクトップクライアント、または Gradio WebUI を好むユーザー。

Highlights

  • Multi-format support: PDF、DOCX、PPTX、XLSX、および画像に対するネイティブな解析。
  • Complex layout handling: 数式(LaTeXへ)、テーブル(HTMLへ)、および自動ヘッダー/フッター削除を伴う人間の読解順序の正確な再構築。
  • Broad integration: LangChain、LlamaIndex、RAGFlow、Dify、および FastGPT とのネイティブな統合、および Cursor と Claude Desktop 用の MCP server サポート。
  • Scalable infrastructure: マルチスレッド並列推論、mineru-router によるマルチGPUデプロイ、および超長ドキュメント用のスライディングウィンドウメカニズム。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト