oomol-lab/wiki-graph

distill any book down to its spine

它解決了什麼問題

LLMs 常常在處理大量來源材料時遇到困難,因為他們需要為每個查詢從頭重新讀取原始數據。Wiki Graph 透過將長文編譯成可維護的結構化知識庫(即「LLM Wiki」概念)來解決此問題,該知識庫保留了實體、關係以及直接指向原始來源的證據。

它是如何運作的

該工具使用 CLI 來擷取文字(來自 PDF、EPUB、網頁等),並將其存儲在自訂的 .wikg 封存格式中。它利用 LLM 來提取實體——透過 WikiSpine 與維基百科/Wikidata 等公開資料集對齊——以及從文本中提取關係(三元組)。它還通過將文本分塊並連接概念上相關的片段來構建「閱讀圖」,這使得生成的摘要能夠追溯到原始來源句子。

它適合誰

  • AI 開發者 建構需要穩定、可驗證知識檢索的代理工作流程。
  • 知識工作者 希望將長文件轉換為可搜尋、結構化且可攜帶的知識庫。
  • 研究人員 需要將特定主張或實體追溯到其确切的來源章節和句子。

特色

  • 可追溯的知識圖譜: 生成包含直接指向來源文本證據連結的實體與關係結構化網絡。
  • 可攜帶的 .wikg 格式: 使用專門的封存格式,將來源文本、章節樹和知識圖譜存儲在單一可共享的檔案中。
  • 公共實體對齊: 使用維基百科/Wikidata QIDs 為提取的實體提供穩定的語義邊界。
  • 上下文打包: 包含一個 pack 指令,將特定的塊或實體轉換為可攜帶的文字,以用於 LLM 提示。
  • 基於 URI 的導航: 採用獨特的 URI 系統,在封存內導航和查詢特定範圍、章節或實體。