AuvaLab/itext2kg

We build KGs the way nature builds matter

해결하는 문제

이 프로젝트는 비구조화된 텍스트에서 지식 그래프(KG)를 구축하고 분석하기 위한 도구 세트를 제공하며, 시간적 동역학, 사실의 포괄성, 그리고 기존 정적 KG가 종종 놓치는 '약한 신호'(희귀하지만 등장 중인 패턴) 탐지라는 도전 과제에 특화되어 있습니다.

작동 방식

이 리포지토리는 세 가지 주요 프레임워크를 통합합니다:

  • ATOM: 시간적 지식 그래프(TKG)를 구축하기 위한 확장 가능한 파이프라인입니다. 텍스트를 최소한의 '원자적 사실'로 분해하여 LLM이 정보를 누락하는 것을 방지하고, 병렬로 5튜플(주어, 서술어, 목적어, 시작 시각, 종료 시각)을 추출한 후, 느린 LLM 호출 대신 코사인 유사도를 사용하여 엔티티 및 관계 해결을 수행하여 글로벌 그래프에 병합합니다.
  • iText2KG: 정적 및 동적 그래프 모두를 지원하는 증분적 KG 구축 프레임워크로, LLM API 호출을 효율적으로 처리하기 위한 비동기 아키텍처를 갖추고 있습니다.
  • C-Unseen: 동적 그래프에서 '약한 신호'를 탐지하는 시스템입니다. LLM 체인-오브-thought를 활용한 희귀 서브그래프 추출기로 주류 서사와 모순되는 서브그래프를 찾고, 약한 신호 알리미를 통해 이러한 패턴이 시간이 지남에 따라 지속되거나 확장되는지 추적합니다.

대상 사용자

뉴스 아카이브나 의료 기록과 같은 시간에 민감한 데이터에서 지식 기반을 구축하는 연구자 및 개발자에게 적합합니다. 높은 사실의 포괄성, 확장성, 그리고 등장하는 트렌드를 탐지할 수 있는 능력이 필요하신 분들께 최적입니다.

주요 특징

  • 병렬 아키텍처: ATOM은 병렬 추출과 LLM에 의존하지 않는 병합을 통해 유사 프레임워크 대비 지연 시간을 90% 이상 감소시킵니다.
  • 이중 시간 모델링: 사실이 관측된 시각과 실제로 유효했던 시각을 모두 추적하여 시간적 오인을 방지합니다.
  • 원자적 분해: 긴 텍스트를 작은 조각으로 나누어 사실의 포괄성을 약 31% 향상시킵니다.
  • 자기 해석 가능성: C-Unseen은 희귀 및 약한 신호 레이블을 직접 그래프에 기록하여 쉽게 검토할 수 있도록 합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트