Alibaba-NLP/VRAG

Multimodal Retrieval-augmented Generation Framework Built by Tongyi Lab, Alibaba Group.

What it solves

VRAG와 VimRAG는 텍스트, 이미지, 비디오에 걸친 멀티모달 Retrieval‑Augmented Generation(RAG) 문제를 해결합니다. 이들은 Vision‑Language Model(VLM)이 거친 관점에서 세밀한 관점으로 정보를 단계적으로 수집하도록 하여, 시각적으로 풍부한 정보를 더 잘 이해하고 방대한 시각 컨텍스트를 탐색할 수 있게 합니다.

How it works

프로젝트는 두 가지 주요 프레임워크를 제공합니다.

  • VRAG: 반복적 추론을 사용해 정보를 수집하는 순수 비주얼 RAG 에이전트.
  • VimRAG: 멀티모달 메모리 그래프와 Graph‑Guided Policy Optimization(GGPO)을 활용하는 멀티모달 추론 프레임워크. 추론 과정을 동적 유향 비순환 그래프(DAG)로 모델링하고, 중복 메모리 노드를 가지치기하여 크레딧 할당과 학습 수렴을 개선합니다.

두 시스템 모두 GVE 및 Qwen3‑VL‑Embedding과 같은 임베딩 모델을 지원하는 멀티모달 검색 엔진에 의존하며, 이미지, PDF(이미지로 변환) 및 비디오 청크를 인덱싱하고 검색합니다.

Who it’s for

대규모 시각 데이터셋(이미지, 비디오, 문서)에 대해 복잡한 추론이 가능한 고급 멀티모달 에이전트를 구축하고자 하는 AI 연구자 및 개발자를 위한 것입니다.

Highlights

  • Multi‑turn Multimodal Training: 강화 학습을 이용한 멀티턴 멀티모달 에이전트 훈련 프레임워크(VRAG‑RL)를 포함합니다.
  • Dynamic Reasoning Visualization: VimRAG는 추론 과정을 실시간 DAG 시각화합니다.
  • Flexible Retrieval: 최첨단 비주얼 임베딩 모델을 사용해 이미지, PDF, 비디오용 맞춤형 리트리버를 구축할 수 있습니다.
  • Extensible Framework: 다양한 도구와의 훈련을 지원하고, 로컬 모델 배포를 위해 vLLM과 통합됩니다.