datalab-to/marker
Convert PDF to markdown + JSON quickly with high accuracy
해결하는 문제
Marker는 PDF, 이미지, PPTX, DOCX, XLSX, HTML 및 EPUB 파일을 포함한 복잡한 문서를 Markdown, JSON, HTML 및 청크와 같은 깨끗하고 구조화된 형식으로 변환합니다. 특히 테이블, 수학 공식, 다단 레이아웃 및 스캔된 페이지가 포함된 문서에서 구조화된 데이터를 추출하는 어려움을 해결하며, 헤더 및 푸터와 같은 불필요한 아티팩트를 제거합니다.
작동 방식
Marker는 문서 인텔리전스에 하이브리드 접근 방식을 사용합니다. 레이아웃 감지 및 OCR에는 Surya라고 불리는 특화된 VLM (Vision Language Model)을 사용합니다. 구성에 따라 두 가지 주요 모드로 작동합니다:
- Balanced Mode: GPU에 최적화되어 있으며, 최고 품질을 보장하기 위해 레이아웃 및 필요한 경우 전체 페이지 OCR에 VLM을 사용합니다.
- Fast Mode: CPU에 최적화되어 있으며, 텍스트 레이어를 우선시하고 수식 및 깨진 텍스트의 정밀 수정을 위해 VLM을 최소한으로 사용합니다.
최대 정확도를 위해 사용자는 LLM (Gemini, Claude 또는 OpenAI 등)을 전달하여 출력을 정제하고, 페이지 간 테이블을 병합하며, 양식 추출을 개선하는 "Hybrid Mode"를 활성화할 수 있습니다.
대상 사용자
Marker는 RAG (Retrieval-Augmented Generation) 또는 데이터셋 생성과 같은 다운스트림 AI 작업을 위해 대량의 문서를 다양한 언어의 기계 판독 가능한 형식으로 변환해야 하는 개발자 및 데이터 과학자를 위해 설계되었습니다.
주요 특징
- 멀티 포맷 지원: PDF, 이미지, Office 문서 및 EPUB 처리.
- 고품질 추출: 테이블, 인라인 수학 공식 (LaTeX) 및 코드 블록을 정확하게 포맷팅.
- 유연한 배포: vLLM 또는 llama.cpp와 같은 백엔드를 사용하여 GPU, CPU 또는 Apple Silicon (MPS)에서 실행.
- LLM 통합: 복잡한 포맷팅에서 더 높은 정확도를 위한 옵션 기반 LLM 부스팅.
- 확장성: 사용자가 사용자 정의 포맷 로직 및 프로세서를 제공할 수 있음.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트