AuvaLab/itext2kg
We build KGs the way nature builds matter
解決的問題
本專案提供一套工具,用於從非結構化文字中構建與分析知識圖譜(KG),特別針對時間動態性、事實完整性,以及傳統靜態KG常遺漏的「弱信號」(稀有但正在出現的模式)檢測等挑戰。
工作原理
此倉儲整合了三個主要框架:
- ATOM:用於構建時間知識圖譜(TKG)的可擴展流程。它將文字分解為最小的「原子事實」,以防止LLM遺漏資訊,並行提取5元組(主詞、謂詞、受詞、開始時間、結束時間),並使用餘弦相似度進行實體與關係消歧,而非依賴緩慢的LLM呼叫,將這些資訊合併為全域圖譜。
- iText2KG:支援靜態與動態圖譜的增量式KG建構框架,具備非同步架構,可高效處理LLM API呼叫。
- C-Unseen:用於動態圖譜中「弱信號」檢測的系統。它使用基於LLM鏈式思維的稀有子圖提取器,找出與主流敘事相矛盾的子圖,並透過弱信號警報器追蹤這些模式是否隨時間持續或擴大。
適用對象
專為從時效性資料(如新聞檔案或醫療記錄)建構知識庫的研究人員與開發者設計,需要高事實完整性、可擴展性,以及檢測新興趨勢的能力。
主要亮點
- 並行架構:ATOM透過並行提取與非LLM依賴的合併,相比類似框架將延遲降低超過90%。
- 雙重時間建模:同時追蹤事實被觀察到的時間與其實際有效時間,防止時間誤標。
- 原子分解:將長文字拆分為小片段,使事實完整性提升約31%。
- 自解釋性:C-Unseen將稀有與弱信號標籤直接寫回圖譜,便於直觀檢視。
相關
- 專案
- 專案
- 專案
- 專案