datalab-to/marker
Convert PDF to markdown + JSON quickly with high accuracy
解決的問題
Marker 可以將複雜的文檔(包括 PDF、圖像、PPTX、DOCX、XLSX、HTML 和 EPUB 檔案)轉換為乾淨、結構化的格式,如 Markdown、JSON、HTML 和分塊(chunks)。它專門解決從包含表格、數學公式、多欄佈局和掃描頁面的文檔中提取結構化數據的難題,同時去除頁首和頁尾等不需要的雜質。
工作原理
Marker 在文檔智能方面採用混合方法。它使用名為 Surya 的專用 VLM(視覺語言模型)進行佈局檢測和 OCR。根據配置,它以兩種主要模式運行:
- 平衡模式 (Balanced Mode):針對 GPU 進行了優化,在必要時使用 VLM 進行佈局檢測和全頁 OCR,以確保最高品質。
- 快速模式 (Fast Mode):針對 CPU 進行了優化,優先考慮文本層,並僅在處理公式和修復亂碼文本時極少量使用 VLM。
為了獲得最高準確度,使用者可以透過傳遞 LLM(如 Gemini、Claude 或 OpenAI)來啟用「混合模式 (Hybrid Mode)」,以優化輸出、合併跨頁表格並改進表單提取。
適用對象
Marker 專為開發人員和數據科學家設計,他們需要將大量文檔轉換為多種語言的機器可讀格式,用於下游 AI 任務,如 RAG(檢索增強生成)或數據集創建。
亮點
- 多格式支援:處理 PDF、圖像、Office 文檔和 EPUB。
- 高品質提取:準確格式化表格、行內數學公式 (LaTeX) 和程式碼區塊。
- 靈活部署:使用 vLLM 或 llama.cpp 等後端,在 GPU、CPU 或 Apple Silicon (MPS) 上運行。
- LLM 整合:可選的基於 LLM 的增強功能,用於提高複雜格式的準確度。
- 可擴展性:允許使用者提供自定義格式邏輯和處理器。
相關
- 專案
- 專案
- 專案
- 專案
- 專案