OpenBMB/VisRAG
Parsing-free RAG supported by VLMs
해결하는 문제
VisRAG은 전통적인 검색 증강 생성(RAG)에서 문서를 텍스트로 파싱할 때 발생하는 정보 손실을 해결합니다. 문서를 텍스트가 아닌 이미지로 취급함으로써 원본 레이아웃과 시각적 데이터를 보존하여 검색 및 생성 과정에서 정보 보존을 극대화합니다.
작동 방식
이 시스템은 세 가지 주요 구성 요소로 이루어진 시각-언어 모델(VLM) 파이프라인을 통해 작동합니다.
- VisRAG-Ret (검색기): 문서를 직접 이미지로 임베딩하여 쿼리에 기반해 관련 시각 페이지를 검색하는 문서 임베딩 모델입니다.
- VisRAG-Gen (생성기): 검색된 이미지를 기반으로 답변을 생성하는 VLM(GPT-4o 또는 MiniCPM-V 등).
- EVisRAG (VisRAG 2.0): 다중 이미지 추론을 향상시키는 고급 엔드투엔드 프레임워크입니다. 이미지 관찰, 증거 기록, 추론, 답변의 네 단계 프로세스를 사용하며, 시각적 인식과 추론을 동시에 최적화하기 위해 Reward-Scoped Group Relative Policy Optimization(RS-GRPO)로 훈련됩니다.
대상 사용자
시각적 레이아웃, 차트, 이미지가 답변에 필수적인 복잡한 문서(PDF 등)를 다루는 개발자 및 연구자.
주요 특징
- 시각 중심 RAG: 문서를 이미지로 임베딩함으로써 파싱에 기인한 정보 손실을 제거.
- 증거 기반 추론: EVisRAG은 최종 추론 전 각 이미지의 증거를 체계적으로 수집하는 접근 방식을 사용.
- RS-GRPO 훈련: 시각적 인식과 추론을 동시에 최적화하기 위한 전용 강화학습 알고리즘을 채택.
- 다중 이미지 지원: 여러 검색된 시각 문서 간의 추론이 필요한 질문에 특별히 설계됨.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트