Ontos-AI/knowhere

Knowhere extracts, parses, and outputs structured chunks ready for AI Agents and RAG.

解決的問題

Knowhere 解決了為 AI 代理準備『髒』或複雜的非結構化文件(如 PDF 和 PowerPoint 簡報)的困難。傳統 RAG 通常依賴孤立片段的平面向量查找或脆弱的 OCR/版面提取,這可能導致文件的原始結構、閱讀順序和視覺上下文遺失,進而導致模型回應不可靠。

工作原理

Knowhere 透過兩步驟流程,將文件轉換為持久且可導航的記憶系統:

  1. 解析並建立記憶:採用雙軌方法。文字軌道 保留原始結構以確保文字文件的可靠性,而 視覺軌道 則使用前沿視覺模型來整體理解複雜頁面。兩條軌道均被歸一化為單一的階層原生模式,儲存導航樹、連結資源與跨文件關係。
  2. 代理檢索:不依賴固定流程,Knowhere 提供一組工具(大綱、結構過濾器、模糊召回等)。AI 代理可自主決定如何探索此記憶——遍歷章節樹或深入特定區域——以尋找並引用可追溯的證據。

適用對象

專為需要從複雜、本地或離線文件集合中進行高精度檢索的 AI 代理與 LLM 工作流程開發者設計,其中結構上下文與視覺證據至關重要。

主要亮點

  • 雙軌解析:結合文字原生提取與基於視覺的頁面理解,適用於複雜 PDF 與簡報。
  • 階層原生記憶:保留文件路徑、頁碼範圍與章節節點,而非孤立的片段。
  • 代理原生檢索:允許代理自主導航文件的章節樹與跨文件圖譜。
  • 基於頁面的引用:提供可追溯的引用,包括來源文件、章節路徑與渲染的視覺證據。
  • 跨文件記憶圖譜:使用類型化實體與關鍵字連接命名空間內的相關文件。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案