OpenBMB/VisRAG
Parsing-free RAG supported by VLMs
What it solves
VisRAG는 전통적인 텍스트 기반 Retrieval‑Augmented Generation(RAG) 파이프라인에서 문서를 텍스트로 파싱한 뒤 검색하는 과정에서 발생하는 정보 손실을 해결합니다. 문서를 이미지로 취급하고 Vision‑Language Model(VLM)을 검색과 생성 모두에 사용함으로써 원본 문서의 전체 시각 정보를 보존합니다.
How it works
프로젝트는 두 가지 주요 단계로 구성됩니다.
- VisRAG (1.0): 문서를 이미지로 직접 임베딩하고 VLM 기반 검색기(VisRAG‑Ret)를 통해 검색한 뒤, VLM 생성기(VisRAG‑Gen)에 전달해 답변을 생성하는 파이프라인.
- EVisRAG (VisRAG 2.0): 다중 이미지 추론을 위해 설계된 엔드‑투‑엔드 프레임워크. 구조화된 4단계 프로세스(이미지 관찰 → 이미지별 특정 증거 기록 → 증거 기반 추론 → 최종 질문 답변)를 사용합니다. Reward‑Scoped Group Relative Policy Optimization(RS‑GRPO)으로 학습하여 시각 인식과 추론을 동시에 최적화합니다.
Who it’s for
PDF와 같이 차트와 표가 포함된 시각적으로 풍부한 문서에 대한 RAG 시스템을 구축하고자 하는 연구자 및 개발자를 위한 것입니다. OCR이나 텍스트 파싱으로 인한 오류를 피하고자 하는 경우에 적합합니다.
Highlights
- Visual-First Retrieval: 문서를 이미지로 임베딩하여 데이터 보존을 극대화합니다.
- Evidence-Guided Reasoning: EVisRAG는 관찰‑증거‑추론‑답변 루프를 구조화하여 다중 이미지 작업을 처리합니다.
- RS‑GRPO Training: 특화된 강화 학습 접근법을 사용해 인식과 추론을 동시에 최적화합니다.
- VLM Integration: Qwen2.5‑VL, MiniCPM‑V 등 모델을 기반으로 구축되었습니다.