oomol-lab/wiki-graph

distill any book down to its spine

What it solves

LLMs은 종종 대량의 원본 자료와 어려움을 겪으며, 이는 매 쿼리마다 원시 데이터를 처음부터 다시 읽도록 요구한다. Wiki Graph는 긴 텍스트를 유지 가능하고 구조화된 지식 기반(즉, "LLM Wiki" 개념)으로 컴파일하여これを 해결하며, 이 지식 기반은 원본 소스로부터의 엔티티, 관계 및 직접 증거를 보존한다.

How it works

이 도구는 CLI를 사용하여 텍스트(PDF, EPUB, 웹 페이지 등)를 수집하고, 사용자 정의 .wikg 아카이브 형식에 저장한다. 이 도구는 LLM을 사용하여 엔티티를 추출하는데, 이 엔티티는 WikiSpine을 통해 Wikipedia/Wikidata와 같은 공개 데이터셋과 정렬되며, 텍스트로부터 관계(삼중체)도 추출한다. 또한 텍스트를 청크로 나누고 개념적으로 관련된 세그먼트를 연결하여 "Reading Graph"를 구축함으로써, 원본 소스 문장과 추적 가능한 요약을 생성할 수 있다.

Who it’s for

  • AI Developers는 안정적이고 검증 가능한 지식 검색이 필요한 에이전트 워크플로우를 구축한다.
  • Knowledge Workers는 장문의 문서를 검색 가능하고 구조화되며 이동 가능한 지식 기반으로 변환하려 한다.
  • Researchers는 특정 주장이나 엔티티를 정확한 소스 챕터와 문장으로 추적해야 한다.

Highlights

  • Traceable Knowledge Graphs: 소스 텍스트와의 직접 증거 링크를 포함하는 엔티티 및 관계의 구조화된 네트워크를 생성한다.
  • Portable .wikg Format: 전문 아카이브 형식을 사용하여 소스 텍스트, 챕터 트리, 지식 그래프를 단일 공유 가능한 파일에 저장한다.
  • Public Entity Alignment: Wikipedia/Wikidata QIDs를 사용하여 추출된 엔티티에 안정적인 의미 경계를 제공한다.
  • Context Packing: 특정 청크 또는 엔티티를 LLM 프롬프트에 사용 가능한 이동 가능한 텍스트로 변환하는 pack 명령을 포함한다.
  • URI-based Navigation: 아카이브 내 특정 범위, 챕터 또는 엔티티를 탐색하고 쿼리하는 고유한 URI 시스템을 사용한다.