oomol-lab/wiki-graph

distill any book down to its spine

解決的問題

Wiki Graph 透過將大量長文本(如書籍、會議記錄和內部文件)轉換為可維護的結構化知識庫,解決了管理難題。它不是讓 LLM 在每次查詢時都從頭開始重新閱讀原始材料,而是將文本編譯成一種持久的格式,其中實體與關係被提取並可以追溯到原始來源。

工作原理

該工具使用 CLI 將文本處理為 .wikg 封存檔。它利用 WikiSpine 來識別與 Wikipedia/Wikidata QID 對齊的公開實體,從而提供穩定的語義基礎。接著使用 LLM 進行消歧與過濾。

核心組件包括:

  • Knowledge Graph:提取實體與三元組 (subject --predicate--> object) 以建立結構化的資訊網絡。
  • Reading Graph:將文本分解為認知塊並將其組織成閱讀鏈,以生成壓縮且可追溯的摘要。
  • Evidence Tracking:每個提取的實體或關係都連結到來源文本中的特定章節與句子,以便進行驗證。
  • URI System:使用穩定的基於 URI 的定址系統(例如 wikg://book.wikg/entity/Q8018)來存取封存檔中的特定範圍或物件。

適用對象

專為需要構建知識密集型工作流的開發人員與 AI Agent 創建者設計,在這些工作流中,資訊必須是可搜尋、可驗證且可移植的。對於那些正在實現用於長文本知識生產的「LLM Wiki」概念的人來說,它特別有用。

亮點

  • 來源可溯源:每一條知識都有指向原始來源文本的證據支持。
  • 公開實體對齊:使用 Wikidata/Wikipedia 對齊來確保穩定性,並避免純生成式提取中常見的幻覺問題。
  • 可移植知識.wikg 格式允許像書籍或課程一樣共享、備份與交付知識庫。
  • CLI 優先設計:提供全面的命令行介面,並具有可發現的說明網路,以便輕鬆整合到 Agent 工作流中。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案