OpenBMB/VisRAG
Parsing-free RAG supported by VLMs
What it solves
VisRAG 解决了传统基于文本的 Retrieval‑Augmented Generation(RAG)流水线中因将文档解析为文本而导致的信息损失问题。通过将文档视为图像,并使用视觉语言模型(VLM)同时负责检索和生成,VisRAG 能保留原始文档的完整视觉信息。
How it works
项目包含两个主要迭代:
- VisRAG (1.0): 一个流水线,直接使用基于 VLM 的检索器 (VisRAG‑Ret) 将文档嵌入为图像,然后传给 VLM 生成器 (VisRAG‑Gen) 生成答案。
- EVisRAG (VisRAG 2.0): 为多图像推理设计的端到端框架。它采用结构化的四步流程:观察图像、为每张图像记录特定证据、基于证据进行推理,最后回答问题。训练时使用 Reward‑Scoped Group Relative Policy Optimization(RS‑GRPO)同时优化视觉感知和推理能力。
Who it’s for
适用于研究人员和开发者,构建针对视觉丰富文档(如包含图表和表格的 PDF)的 RAG 系统,并希望避免 OCR 或文本解析带来的错误。
Highlights
- Visual-First Retrieval: 将文档嵌入为图像,以最大化数据保留。
- Evidence-Guided Reasoning: EVisRAG 使用结构化的观察‑证据‑推理‑回答循环处理多图像任务。
- RS‑GRPO Training: 采用专门的强化学习方法,同时优化感知与推理。
- VLM Integration: 基于 Qwen2.5‑VL、MiniCPM‑V 等模型构建。