oomol-lab/wiki-graph

distill any book down to its spine

解決する課題

LLMは膨大なソース資料の扱いに苦戦することが多く、クエリのたびに生のデータを最初から読み直す必要があります。Wiki Graphは、長いテキストを、エンティティ、関係性、および元のソースへの直接的な証拠を保持する、メンテナンス可能な構造化知識ベース(「LLM Wiki」コンセプト)にコンパイルすることで、この問題を解決します。

仕組み

このツールはCLIを使用してテキスト(PDF、EPUB、ウェブページなど)を取り込み、カスタムの .wikg アーカイブ形式で保存します。LLMを使用して、テキストからエンティティ(WikiSpineを介してWikipedia/Wikidataなどの公開データセットと整合)と関係性(トリプル)を抽出します。また、テキストをチャンク化して概念的に関連するセグメントを接続することで「Reading Graph」を構築し、元のソースの文章まで遡ることができる要約の生成を可能にします。

対象ユーザー

  • AI Developers: 安定した、検証可能な知識検索を必要とするエージェント的ワークフローを構築している開発者。
  • Knowledge Workers: 長い文書を、検索可能で構造化された、ポータブルな知識ベースに変換したいと考えているナレッジワーカー。
  • Researchers: 特定の主張やエンティティを、正確なソースの章や文章まで遡って確認する必要がある研究者。

ハイライト

  • Traceable Knowledge Graphs: ソーステキストへの直接的な証拠リンクを含む、エンティティと関係性の構造化されたネットワークを生成します。
  • Portable .wikg Format: 特殊なアーカイブ形式を使用して、ソーステキスト、章のツリー、および知識グラフを単一の共有可能なファイルに保存します。
  • Public Entity Alignment: Wikipedia/WikidataのQIDを使用して、抽出されたエンティティに対して安定した意味的境界を提供します。
  • Context Packing: 特定のチャンクやエンティティを、LLMのプロンプトで使用できるポータブルなテキストに変換する pack コマンドが含まれています。
  • URI-based Navigation: アーカイブ内の特定のスコープ、章、またはエンティティをナビゲートおよびクエリするために、独自のURIシステムを採用しています。