OpenBMB/VisRAG
Parsing-free RAG supported by VLMs
What it solves
VisRAG 解決了傳統文字為主的 Retrieval‑Augmented Generation(RAG)流程中因將文件解析成文字而產生的資訊遺失問題。透過將文件視為圖像,並使用視覺語言模型(VLM)同時負責檢索與生成,VisRAG 能保留原始文件的完整視覺資訊。
How it works
此專案包含兩個主要階段:
- VisRAG (1.0): 一條管線,直接以 VLM 為基礎的檢索器 (VisRAG‑Ret) 將文件嵌入為圖像,然後傳給 VLM 生成器 (VisRAG‑Gen) 產生答案。
- EVisRAG (VisRAG 2.0): 為多圖像推理設計的端到端框架。它採用結構化的四步流程:觀察圖像、為每張圖像記錄特定證據、基於證據進行推理,最後回答問題。訓練時使用 Reward‑Scoped Group Relative Policy Optimization(RS‑GRPO)同時優化視覺感知與推理能力。
Who it’s for
適合研究人員與開發者,構建針對視覺豐富文件(如含圖表與表格的 PDF)的 RAG 系統,並希望避免 OCR 或文字解析所帶來的錯誤。
Highlights
- Visual-First Retrieval: 將文件嵌入為圖像,以最大化資料保留。
- Evidence-Guided Reasoning: EVisRAG 使用結構化的觀察‑證據‑推理‑回答迴路處理多圖像任務。
- RS‑GRPO Training: 採用專門的強化學習方法,同時優化感知與推理。
- VLM Integration: 基於 Qwen2.5‑VL、MiniCPM‑V 等模型構建。