AuvaLab/itext2kg
We build KGs the way nature builds matter
何を解決するか
このプロジェクトは、非構造化テキストから知識グラフ(KG)を構築・分析するためのツールセットを提供し、時間的動態、事実の網羅性、および従来の静的KGがしばしば見逃す「弱い信号」(まれだが出現しつつあるパターン)の検出という課題に特化しています。
動作方法
このリポジトリは3つの主要なフレームワークを統合しています:
- ATOM: 時間的知識グラフ(TKG)を構築するスケーラブルなパイプライン。テキストを最小限の「原子的事実」に分解することで、LLMが情報を省略するのを防ぎ、並列で5タプル(主語、述語、目的語、開始時刻、終了時刻)を抽出し、エンティティおよび関係の解決には遅いLLM呼び出しではなくコサイン類似度を使用してグローバルグラフに統合します。
- iText2KG: 静的および動的グラフの両方をサポートするインクリメンタルKG構築フレームワーク。LLM API呼び出しを効率的に処理するための非同期アーキテクチャを備えています。
- C-Unseen: 動的グラフにおける「弱い信号」を検出するシステム。LLM Chain-of-Thoughtを用いたレアサブグラフ抽出器で支配的ナラティブと矛盾するサブグラフを発見し、弱い信号アラートシステムでこれらのパターンが時間とともに継続するか拡大するかを追跡します。
対象ユーザー
ニュースアーカイブや医療記録など、時間に敏感なデータから知識ベースを構築する研究者や開発者向けです。高精度な事実カバレッジ、スケーラビリティ、そして出現するトレンドを検出できる能力が必要な方々に最適です。
主な特徴
- 並列アーキテクチャ: ATOMは並列抽出とLLM非依存のマージにより、類似フレームワークと比較して遅延を90%以上削減します。
- 二重時間モデリング: 事実が観測された時刻と実際に有効だった時刻の両方を追跡し、時間的誤認を防ぎます。
- 原子的分解: 長いテキストを小さなスニペットに分割することで、事実の網羅性を約31%向上します。
- 自己解釈可能: C-Unseenは、レアおよび弱い信号のラベルを直接グラフに書き戻すため、簡単に確認できます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト