oomol-lab/spinedigest
distill any book down to its spine
解決する課題
Wiki Graphは、LLM向けの長文ナレッジベース管理の課題に対処します。AIにクエリのたびに生のソース資料をゼロから処理させるのではなく、長文を耐久性があり、保守可能で、追跡可能なナレッジベースにコンパイルします。これにより、繰り返しの抽出作業を回避し、公開エンティティと検証可能なソースエビデンスに知識をグラウンディングすることで、ハルシネーションを低減します。
仕組み
CLIを使用して長文を .wikg アーカイブに処理します。システムは、主にWikiSpineを介してWikipediaやWikidataの公開エンティティと照合することにより、テキストからエンティティとリレーション(トリプル)を抽出します。これにより、プライベートで進化し続けるスキーマに依存するのではなく、共有された公開辞書を使用することで安定性を確保します。
主なコンポーネントは以下の通りです:
- Knowledge Graph: 関連する概念をナビゲートできるようにする、エンティティとトリプル (
subject --predicate--> object) のネットワーク。 - Evidence Tracking: 検証のために、すべてのエンティティとリレーションはソーステキスト内の特定の章や元の文章にリンクされています。
- Reading Graph: 要約のために、ツールはテキストを認知的なチャンクに分割し、それらを関連性に基づいて接続することで、ソースまで追跡可能な圧縮された要約を生成します。
- URI System: ナレッジベース内の特定のスコープやオブジェクトをアドレス指定および操作するために使用される、安定したハンドルシステム(例:
wikg://archive/entity/QID)。
対象ユーザー
大量のテキスト(PDF、EPUB、ウェブページなど)を取り込み、それらを構造化され、検索可能で、検証可能なナレッジベースに変換する必要があるAIエージェントのワークフローを構築している開発者向けに設計されています。
ハイライト
- ソースの追跡可能性: 抽出されたすべての知識は、元のソースの文章まで遡ることができます。
- 公開エンティティへのグラウンディング: Wikidata/WikipediaのQIDを使用して、異なるドキュメント間でも一貫したエンティティ識別を保証します。
- ポータブルなアーカイブ: すべてを共有、バックアップ、または移動可能な
.wikgファイルに保存します。 - 構造化されたナビゲーション: キーワード検索だけでなく、エンティティとリレーションのグラフを介してナレッジベースを照会することを可能にします。