oomol-lab/wiki-graph
distill any book down to its spine
解決する課題
Wiki Graphは、大量の長文テキスト(書籍、会議記録、内部文書など)を、保守可能な構造化ナレッジベースに変換することで、その管理の難しさを解決します。クエリのたびにLLMに生の資料を最初から読み直させるのではなく、テキストを耐久性のある形式にコンパイルし、エンティティとリレーションを抽出して元のソースまで追跡可能にします。
仕組み
このツールはCLIを使用して、テキストを .wikg アーカイブに処理します。WikiSpineを活用して、Wikipedia/WikidataのQIDに準拠した公開エンティティを特定し、安定したセマンティックな基盤を提供します。その後、LLMを使用して曖昧さの回避とフィルタリングを行います。
主なコンポーネントは以下の通りです:
- Knowledge Graph: エンティティとトリプル (
subject --predicate--> object) を抽出し、構造化された情報ネットワークを作成します。 - Reading Graph: テキストを認知的なチャンクに分割し、それらを読解チェーンとして整理することで、圧縮された追跡可能な要約を生成します。
- Evidence Tracking: 抽出されたすべてのエンティティやリレーションは、検証のためにソーステキストの特定の章や文章にリンクされています。
- URI System: 安定したURIベースののアドレス指定システム(例:
wikg://book.wikg/entity/Q8018)を使用して、アーカイブ内の特定のスコープやオブジェクトにアクセスします。
対象ユーザー
情報が検索可能で、検証可能かつポータブルである必要がある、知識集約型のワークフローを構築する必要のある開発者やAIエージェントの作成者向けに設計されています。特に、長文テキストの知識生成のための「LLM Wiki」コンセプトを実装しようとしている方に適しています。
ハイライト
- ソース追跡可能: すべての知識は、元のソーステキストを指し示す証拠によって裏付けられています。
- 公開エンティティのグラウンディング: Wikidata/Wikipediaとのアライメントを使用して安定性を確保し、純粋な生成型抽出でよく見られるハルシネーションを回避します。
- ポータブルな知識:
.wikg形式により、ナレッジベースを本やコースのように共有、バックアップ、配信することが可能です。 - CLIファースト設計: エージェントのワークフローへの容易な統合のために、発見可能なヘルプネットワークを備えた包括的なコマンドラインインターフェースを提供します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト