robert-mcdermott/ai-knowledge-graph

AI Powered Knowledge Graph Generator

해결하는 문제

이 프로젝트는 비구조화된 텍스트 문서를 구조화되고 상호작용 가능한 지식 그래프로 자동 변환하는 과정을 자동화합니다. 텍스트 내에서 엔티티와 그 관계를 수동으로 식별하는 노동을 제거하여, 사용자가 복잡한 연결을 시각화하고 LLM을 사용해 결과 데이터를 질의할 수 있도록 합니다.

작동 방식

이 시스템은 다단계 파이프라인을 따릅니다:

  1. 추출: 입력 텍스트(PDF, DOCX, Markdown 등)를 청크로 분할하고, LLM을 사용해 주어-서술어-목적어(SPO) 트리플릿을 추출합니다. 엔티티 유형(예: 사람, 조직, 기술)도 포함됩니다.
  2. 표준화: 동일한 엔티티의 변형(예: 대소문자, 복수형)을 결정론적 규칙과 선택적 LLM 처리를 통해 통합합니다.
  3. 추론: LLM 기반의 브리징 및 허브 확장, 그리고 분류 규칙을 사용해 그래프의 고립된 부분을 연결하고 잘 알려진 관계를 추가합니다.
  4. 시각화 및 질의: 상호작용 가능한 탐색을 위한 자체 포함형 HTML 파일을 생성합니다. 사용자는 graph-chat 명령어 또는 로컬 웹 서버(graph-serve)를 사용해 그래프에 저장된 사실만을 기반으로 질문에 답할 수 있습니다.

대상 사용자

  • 대량의 문서에서 복잡한 관계를 맵핑해야 하는 연구자 및 분석가.
  • 텍스트에서 추출된 지식을 시각적이고 추적 가능한 방식으로 탐색하고 싶은 사용자.
  • 비구조화된 텍스트를 JSON, CSV, GraphML, 또는 Neo4j용 Cypher 형식으로 변환할 수 있는 도구를 찾는 개발자.

주요 특징

  • 광범위한 입력 지원: .txt, .md, .rst, .pdf, .docx 파일을 모든 언어에서 처리 가능.
  • 추적 가능한 답변: 챗 기능은 원본 문장이나 추론 방법에 대한 인용과 함께 근거 있는 답변을 제공합니다.
  • 유연한 LLM 통합: Ollama 및 LM Studio와 같은 로컬 옵션을 포함한 모든 OpenAI 호환 엔드포인트와 호환됩니다.
  • 인터랙티브 탐색기: 검색, 커뮤니티 탐지, 최단 경로 탐색 기능을 갖춘 독립형 HTML 파일을 생성합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트