usc-isi-i2/kgtk

Knowledge Graph Toolkit

何を解決するか

KGTKは、メモリに収まらないほど巨大なハイパーリレーショナル知識グラフ(KG)の作成と分析の難しさに対処します。標準的なハードウェア(例:ラップトップ)上で、ディスクベースのアプローチを用いて数十億のエッジを扱えるスケーラブルなフレームワークを提供します。

動作方法

KGTKは、エッジ識別子、ヘッド、エッジラベル、テールの4列からなるシンプルなタブ区切り(TSV)ファイルとして知識グラフを表現します。この形式により、ユーザーはインポート、変換、フィルタリング、結合などのグラフ処理パイプラインを構築できます。専用のクエリ言語(Cypherの変種)がディスクベースのストレージに最適化されており、PageRankなどのグラフ解析ツール、テキストおよびグラフ埋め込みの生成ツールも含まれます。

対象ユーザー

大規模な意味的データを扱う研究者や開発者、特にWikidata、RDF、またはカスタムの常識知識グラフの構築に注力する人々に向けられています。

主な特徴

  • スケーラブルな処理: ラップトップ上でWikidata規模のグラフ(数十億エッジ)を処理可能。
  • 包括的なパイプライン: RDF/Wikidataからのインポート、クリーニング、ユニオン、ElasticSearchやJSONなどへのエクスポートをサポートするツールを備える。
  • 高度な解析機能: 中心性指標、連結成分、最短経路、グラフ埋め込みをサポート。
  • 統合性: JupyterノートブックとPandasとシームレスに統合され、開発に優れた環境を提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト