OpenBMB/VisRAG

Parsing-free RAG supported by VLMs

解决的问题

VisRAG 解决了传统检索增强生成(RAG)中将文档解析为文本时发生的信息丢失问题。通过将文档作为图像而非文本处理,它保留了原始布局和视觉数据,从而在检索和生成过程中最大化信息保留。

工作原理

该系统通过一个由三个主要组件组成的视觉-语言模型(VLM)管道运行:

  1. VisRAG-Ret(检索器): 一种文档嵌入模型,直接将文档作为图像进行嵌入,根据查询检索相关的视觉页面。
  2. VisRAG-Gen(生成器): 一种 VLM(如 GPT-4o 或 MiniCPM-V),基于检索到的图像生成答案。
  3. EVisRAG(VisRAG 2.0): 一种先进的端到端框架,可提升多图像推理能力。它采用四步流程——观察图像、记录证据、推理、作答——并通过 Reward-Scoped Group Relative Policy Optimization(RS-GRPO)进行训练,以同时优化视觉感知和推理能力。

适用人群

处理复杂文档(如 PDF)的开发者和研究人员,其中视觉布局、图表和图像对答案至关重要,且无法通过纯文本解析轻松捕获。

主要亮点

  • 视觉优先的 RAG: 通过将文档作为图像嵌入,消除解析导致的信息丢失。
  • 证据引导的推理: EVisRAG 采用结构化方法,在最终推理前收集每张图像的证据。
  • RS-GRPO 训练: 采用专用强化学习算法,联合优化感知与推理能力。
  • 多图像支持: 专门设计用于处理需要跨多个检索到的视觉文档进行推理的问题。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目