OpenBMB/VisRAG
Parsing-free RAG supported by VLMs
解決的問題
VisRAG 解決了傳統檢索增強生成(RAG)中將文件解析為文字時所產生的資訊損失問題。透過將文件視為影像而非文字處理,它保留了原始版面與視覺資料,從而在檢索與生成過程中最大化資訊保留。
工作原理
該系統透過一個由三個主要元件組成的視覺-語言模型(VLM)管道運作:
- VisRAG-Ret(檢索器): 一種文件嵌入模型,直接將文件作為影像進行嵌入,根據查詢檢索相關的視覺頁面。
- VisRAG-Gen(生成器): 一種 VLM(如 GPT-4o 或 MiniCPM-V),根據檢索到的影像生成答案。
- EVisRAG(VisRAG 2.0): 一種先進的端對端框架,可提升多影像推理能力。它採用四步流程——觀察影像、記錄證據、推理、作答——並透過 Reward-Scoped Group Relative Policy Optimization(RS-GRPO)進行訓練,以同時優化視覺感知與推理能力。
適用對象
處理複雜文件(如 PDF)的開發者與研究人員,其中視覺版面、圖表與影像對答案至關重要,且無法透過純文字解析輕易捕捉。
主要亮點
- 視覺優先的 RAG: 透過將文件作為影像嵌入,消除解析所導致的資訊損失。
- 證據引導的推理: EVisRAG 採用結構化方法,在最終推理前收集每張影像的證據。
- RS-GRPO 訓練: 採用專用強化學習演算法,聯合優化感知與推理能力。
- 多影像支援: 專門設計用於處理需要跨多個檢索到的視覺文件進行推理的問題。
相關
- 專案
- 專案
- 專案
- 專案
- 專案