datalab-to/marker

Convert PDF to markdown + JSON quickly with high accuracy

解決的問題

Marker 可以將複雜的文檔(包括 PDF、圖像、PPTX、DOCX、XLSX、HTML 和 EPUB 檔案)轉換為乾淨、結構化的格式,如 Markdown、JSON、HTML 和分塊(chunks)。它專門解決從包含表格、數學公式、多欄佈局和掃描頁面的文檔中提取結構化數據的難題,同時去除頁首和頁尾等不需要的雜質。

工作原理

Marker 在文檔智能方面採用混合方法。它使用名為 Surya 的專用 VLM(視覺語言模型)進行佈局檢測和 OCR。根據配置,它以兩種主要模式運行:

  • 平衡模式 (Balanced Mode):針對 GPU 進行了優化,在必要時使用 VLM 進行佈局檢測和全頁 OCR,以確保最高品質。
  • 快速模式 (Fast Mode):針對 CPU 進行了優化,優先考慮文本層,並僅在處理公式和修復亂碼文本時極少量使用 VLM。

為了獲得最高準確度,使用者可以透過傳遞 LLM(如 Gemini、Claude 或 OpenAI)來啟用「混合模式 (Hybrid Mode)」,以優化輸出、合併跨頁表格並改進表單提取。

適用對象

Marker 專為開發人員和數據科學家設計,他們需要將大量文檔轉換為多種語言的機器可讀格式,用於下游 AI 任務,如 RAG(檢索增強生成)或數據集創建。

亮點

  • 多格式支援:處理 PDF、圖像、Office 文檔和 EPUB。
  • 高品質提取:準確格式化表格、行內數學公式 (LaTeX) 和程式碼區塊。
  • 靈活部署:使用 vLLM 或 llama.cpp 等後端,在 GPU、CPU 或 Apple Silicon (MPS) 上運行。
  • LLM 整合:可選的基於 LLM 的增強功能,用於提高複雜格式的準確度。
  • 可擴展性:允許使用者提供自定義格式邏輯和處理器。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案