oomol-lab/wiki-graph
distill any book down to its spine
解決的問題
Wiki Graph 透過將大量長文本(如書籍、會議記錄和內部文件)轉換為可維護的結構化知識庫,解決了管理難題。它不是讓 LLM 在每次查詢時都從頭開始重新閱讀原始材料,而是將文本編譯成一種持久的格式,其中實體與關係被提取並可以追溯到原始來源。
工作原理
該工具使用 CLI 將文本處理為 .wikg 封存檔。它利用 WikiSpine 來識別與 Wikipedia/Wikidata QID 對齊的公開實體,從而提供穩定的語義基礎。接著使用 LLM 進行消歧與過濾。
核心組件包括:
- Knowledge Graph:提取實體與三元組 (
subject --predicate--> object) 以建立結構化的資訊網絡。 - Reading Graph:將文本分解為認知塊並將其組織成閱讀鏈,以生成壓縮且可追溯的摘要。
- Evidence Tracking:每個提取的實體或關係都連結到來源文本中的特定章節與句子,以便進行驗證。
- URI System:使用穩定的基於 URI 的定址系統(例如
wikg://book.wikg/entity/Q8018)來存取封存檔中的特定範圍或物件。
適用對象
專為需要構建知識密集型工作流的開發人員與 AI Agent 創建者設計,在這些工作流中,資訊必須是可搜尋、可驗證且可移植的。對於那些正在實現用於長文本知識生產的「LLM Wiki」概念的人來說,它特別有用。
亮點
- 來源可溯源:每一條知識都有指向原始來源文本的證據支持。
- 公開實體對齊:使用 Wikidata/Wikipedia 對齊來確保穩定性,並避免純生成式提取中常見的幻覺問題。
- 可移植知識:
.wikg格式允許像書籍或課程一樣共享、備份與交付知識庫。 - CLI 優先設計:提供全面的命令行介面,並具有可發現的說明網路,以便輕鬆整合到 Agent 工作流中。
相關
- 專案
- 專案
- 專案
- 專案
- 專案