docling-project/docling

Get your documents ready for gen AI

해결하는 문제

Docling은 다양한 복잡한 문서 형식을 생성형 AI 애플리케이션에 적합한 구조화되고 기계가 읽을 수 있는 형식으로 변환하는 과정을 단순화합니다. 일반적으로 LLM이 직접 처리하기 어려운 고급 PDF 레이아웃, 표, 다중 모달 콘텐츠(이미지 및 오디오 포함)의 파싱 문제를 해결합니다.

작동 방식

Docling은 PDF, Office 문서, HTML, 심지어 비디오/오디오 파일까지 다양한 파일 형식을 분석하고 DoclingDocument라는 통합 문서 표현 형식을 사용하여 Markdown 또는 JSON과 같은 형식으로 내보냅니다. 스캔된 문서에는 OCR을, 고급 레이아웃 이해에는 시각 언어 모델(VLM)을, 오디오/비디오 전사에는 자동 음성 인식(ASR)을 활용합니다.

대상 사용자

AI 에이전트, RAG(검색 보강 생성) 파이프라인, 문서 처리 워크플로우를 구축하는 개발자들을 위한 도구입니다. 비구조화된 문서를 깨끗한 구조화된 데이터로 변환해야 하는 분들에게 적합합니다.

주요 특징

  • 다중 모달 파싱: PDF, DOCX, PPTX, XLSX, HTML, EPUB, 이메일 형식, 비디오/오디오 파일 등 다양한 형식을 지원합니다.
  • 고급 PDF 이해: 페이지 레이아웃, 읽기 순서, 표 구조, 수식을 처리합니다.
  • AI 생태계 통합: LangChain, LlamaIndex, Crew AI, Haystack에 대한 네이티브 플러그 앤 플레이 지원.
  • 로컬 실행 가능: 민감한 데이터 및 에어갭 환경에서도 로컬에서 실행 가능합니다.
  • 차트 이해: 막대 그래프, 원형 그래프, 선 그래프 등을 표나 코드로 변환하고 상세한 설명을 제공합니다.
  • 유연한 내보내기: Markdown, HTML, JSON, USPTO 및 JATS와 같은 특정 XML 스키마로 내보낼 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트