HKUDS/RAG-Anything

"RAG-Anything: All-in-One RAG Framework"

解決的問題

傳統的RAG系統主要聚焦於文字,難以處理包含圖片、表格和數學公式等混合內容的文件。RAG-Anything提供了一個一體化的框架,無需多個專用工具,即可在單一系統內無縫處理與查詢所有這些模態的內容。

工作原理

基於LightRAG實作多階段多模態流程:

  1. 文件解析:使用MinerU從PDF、Office文件和影像中高保真地提取文字、視覺元素與表格。
  2. 內容分析:自動分類內容,並導向專用分析器(例如,圖片用的視覺內容分析器、表格用的結構化資料解釋器、LaTeX公式用的數學表達式解析器)。
  3. 知識圖譜索引:將多模態元素轉換為結構化實體,並建立跨模態關係,保留原始文件的層級結構。
  4. 模態感知檢索:結合向量相似性搜尋與圖形遍歷,檢索內容,並使用自適應排序根據查詢的模態偏好對結果加權。

適用對象

本工具專為處理豐富混合內容文件的使用者設計,特別適用於學術研究、技術文件、財務報告與企業知識管理領域。

核心亮點

  • 端對端流程:從資料攝取、解析到多模態查詢回應,全程自動化處理。
  • 通用格式支援:支援PDF、Office文件(DOCX、PPTX、XLSX)與影像。
  • 多模態知識圖譜:自動提取實體並發現不同內容類型之間的關係。
  • VLM增強查詢:整合視覺語言模型(VLM),聯合分析圖片與文字上下文,獲得更深入洞察。
  • 混合檢索機制:融合向量搜尋與圖形遍歷,實現更全面的資訊恢復。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案