oomol-lab/spinedigest
distill any book down to its spine
解決的問題
Wiki Graph 解決了為 LLM 管理長文本知識庫的挑戰。它不是強迫 AI 為每個查詢從頭開始處理原始素材,而是將長文本編譯成持久、可維護且可追溯的知識庫。這避免了重複提取的需求,並透過將知識錨定在公開實體與可驗證的來源證據中來減少幻覺。
工作原理
使用 CLI 將長文本處理為 .wikg 封存檔。系統主要透過 WikiSpine 將實體與來自 Wikipedia 和 Wikidata 的公開實體進行對齊,從而從文本中提取實體與關係(三元組)。透過使用共享的公開詞典而非依賴私有的、不斷演變的模式,確保了穩定性。
核心組件包括:
- Knowledge Graph:一個由實體與三元組 (
subject --predicate--> object) 組成的網絡,允許使用者瀏覽相關概念。 - Evidence Tracking:每個實體與關係都連結回來源文本中的特定章節與原始句子,以便進行驗證。
- Reading Graph:對於摘要,該工具將文本分解為認知區塊,並按相關性將它們連接起來,以生成可追溯到來源的壓縮摘要。
- URI System:一種穩定的句柄系統(例如
wikg://archive/entity/QID),用於對知識庫中的特定範圍或物件進行定址與操作。
適用對象
專為構建 AI Agent 工作流的開發人員設計,這些工作流需要攝取大量文本(PDF、EPUB、網頁等)並將其轉換為結構化、可搜尋且可驗證的知識庫。
亮點
- 來源可追溯性:每條提取的知識都可以追溯到原始來源句子。
- 公開實體對齊:使用 Wikidata/Wikipedia QID 確保在不同文件之間實現一致的實體識別。
- 可攜式封存:將所有內容儲存在可以共享、備份或移動的
.wikg檔案中。 - 結構化導航:允許透過實體與關係的圖譜而非僅僅透過關鍵字搜尋來查詢知識庫。