OpenBMB/VisRAG

Parsing-free RAG supported by VLMs

解決的問題

VisRAG 解決了傳統檢索增強生成(RAG)中將文件解析為文字時所產生的資訊損失問題。透過將文件視為影像而非文字處理,它保留了原始版面與視覺資料,從而在檢索與生成過程中最大化資訊保留。

工作原理

該系統透過一個由三個主要元件組成的視覺-語言模型(VLM)管道運作:

  1. VisRAG-Ret(檢索器): 一種文件嵌入模型,直接將文件作為影像進行嵌入,根據查詢檢索相關的視覺頁面。
  2. VisRAG-Gen(生成器): 一種 VLM(如 GPT-4o 或 MiniCPM-V),根據檢索到的影像生成答案。
  3. EVisRAG(VisRAG 2.0): 一種先進的端對端框架,可提升多影像推理能力。它採用四步流程——觀察影像、記錄證據、推理、作答——並透過 Reward-Scoped Group Relative Policy Optimization(RS-GRPO)進行訓練,以同時優化視覺感知與推理能力。

適用對象

處理複雜文件(如 PDF)的開發者與研究人員,其中視覺版面、圖表與影像對答案至關重要,且無法透過純文字解析輕易捕捉。

主要亮點

  • 視覺優先的 RAG: 透過將文件作為影像嵌入,消除解析所導致的資訊損失。
  • 證據引導的推理: EVisRAG 採用結構化方法,在最終推理前收集每張影像的證據。
  • RS-GRPO 訓練: 採用專用強化學習演算法,聯合優化感知與推理能力。
  • 多影像支援: 專門設計用於處理需要跨多個檢索到的視覺文件進行推理的問題。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案