docling-project/docling-graph
Transform unstructured documents into validated, rich and queryable knowledge graphs.
해결하는 문제
Docling Graph는 복잡한 문서(PDF, 이미지, Office 파일 등)에서 구조화된 고정밀 데이터를 추출하고, 방향성 지식 그래프로 변환하는 문제를 해결합니다. 일반적인 RAG 시스템이 근사적인 텍스트 임베딩에 의존하는 것과 달리, 이 도구는 화학 물질과 반응, 금융 상품과 그 의존성과 같은 엔티티 간의 정확한 의미 관계를 보장합니다. 화학, 금융, 법조 분야와 같은 전문 분야에서 필수적입니다.
작동 방식
시스템은 설정 기반 파이프라인을 사용하여 문서를 검증된 Pydantic 객체로 변환한 후 NetworkX 방향 그래프로 변환합니다. 주로 두 가지 추출 경로를 지원: Docling을 통한 로컬 VLM(Vision Language Model) 추출 또는 LiteLLM를 통해 라우팅되는 LLM 기반 추출(OpenAI, Gemini, vLLM 등 다양한 제공업체 지원). 사용자는 Pydantic 템플릿을 사용해 추출 스키마를 정의할 수 있으며, 수동으로 작성하거나 예시 문서에서 유도하거나 기존 온톨로지(OWL/RDFS)에서 컴파일할 수 있습니다.
대상 사용자
비구조화된 문서를 엄격한 검증과 데이터 기반을 갖춘 기계 가독성 지식 그래프로 변환해야 하는 고정밀 도메인(법률, 금융, 화학 연구 등)에서 일하는 개발자 및 데이터 과학자에게 적합합니다.
주요 특징
- 템플릿 생성: 예시 문서에서 Pydantic 템플릿을 자동으로 유도하거나, 공식 온톨로지에서 컴파일 가능.
- 데이터 기반: 추출 위치를 정확히 추적할 수 있는 결정론적 프로벤ance 레지스트리(경계 상자 기하학 포함) 제공.
- 유연한 백엔드: 로컬 런타임(Ollama, vLLM)과 원격 API 모두 지원하는 VLM 및 LLM 추출.
- 그래프 융합: 추가 LLM 호출 없이 여러 지식 그래프를 하나의 감사 가능하고 결정론적인 그래프로 병합 가능.
- 광범위한 포맷 지원: Docling 통합을 통해 PDF, 이미지, 마크다운, Office 파일 처리 가능.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트