AuvaLab/itext2kg

We build KGs the way nature builds matter

解決的問題

本專案提供一套工具,用於從非結構化文字中構建與分析知識圖譜(KG),特別針對時間動態性、事實完整性,以及傳統靜態KG常遺漏的「弱信號」(稀有但正在出現的模式)檢測等挑戰。

工作原理

此倉儲整合了三個主要框架:

  • ATOM:用於構建時間知識圖譜(TKG)的可擴展流程。它將文字分解為最小的「原子事實」,以防止LLM遺漏資訊,並行提取5元組(主詞、謂詞、受詞、開始時間、結束時間),並使用餘弦相似度進行實體與關係消歧,而非依賴緩慢的LLM呼叫,將這些資訊合併為全域圖譜。
  • iText2KG:支援靜態與動態圖譜的增量式KG建構框架,具備非同步架構,可高效處理LLM API呼叫。
  • C-Unseen:用於動態圖譜中「弱信號」檢測的系統。它使用基於LLM鏈式思維的稀有子圖提取器,找出與主流敘事相矛盾的子圖,並透過弱信號警報器追蹤這些模式是否隨時間持續或擴大。

適用對象

專為從時效性資料(如新聞檔案或醫療記錄)建構知識庫的研究人員與開發者設計,需要高事實完整性、可擴展性,以及檢測新興趨勢的能力。

主要亮點

  • 並行架構:ATOM透過並行提取與非LLM依賴的合併,相比類似框架將延遲降低超過90%。
  • 雙重時間建模:同時追蹤事實被觀察到的時間與其實際有效時間,防止時間誤標。
  • 原子分解:將長文字拆分為小片段,使事實完整性提升約31%。
  • 自解釋性:C-Unseen將稀有與弱信號標籤直接寫回圖譜,便於直觀檢視。

相關

  • 專案
  • 專案
  • 專案
  • 專案