oomol-lab/wiki-graph
distill any book down to its spine
它解決了什麼問題
LLMs 常常在處理大量來源材料時遇到困難,因為他們需要為每個查詢從頭重新讀取原始數據。Wiki Graph 透過將長文編譯成可維護的結構化知識庫(即「LLM Wiki」概念)來解決此問題,該知識庫保留了實體、關係以及直接指向原始來源的證據。
它是如何運作的
該工具使用 CLI 來擷取文字(來自 PDF、EPUB、網頁等),並將其存儲在自訂的 .wikg 封存格式中。它利用 LLM 來提取實體——透過 WikiSpine 與維基百科/Wikidata 等公開資料集對齊——以及從文本中提取關係(三元組)。它還通過將文本分塊並連接概念上相關的片段來構建「閱讀圖」,這使得生成的摘要能夠追溯到原始來源句子。
它適合誰
- AI 開發者 建構需要穩定、可驗證知識檢索的代理工作流程。
- 知識工作者 希望將長文件轉換為可搜尋、結構化且可攜帶的知識庫。
- 研究人員 需要將特定主張或實體追溯到其确切的來源章節和句子。
特色
- 可追溯的知識圖譜: 生成包含直接指向來源文本證據連結的實體與關係結構化網絡。
- 可攜帶的
.wikg格式: 使用專門的封存格式,將來源文本、章節樹和知識圖譜存儲在單一可共享的檔案中。 - 公共實體對齊: 使用維基百科/Wikidata QIDs 為提取的實體提供穩定的語義邊界。
- 上下文打包: 包含一個
pack指令,將特定的塊或實體轉換為可攜帶的文字,以用於 LLM 提示。 - 基於 URI 的導航: 採用獨特的 URI 系統,在封存內導航和查詢特定範圍、章節或實體。