Alibaba-NLP/VRAG

Multimodal Retrieval-augmented Generation Framework Built by Tongyi Lab, Alibaba Group.

What it solves

VRAG 和 VimRAG 解决了跨文本、图像和视频的多模态 Retrieval‑Augmented Generation(RAG)挑战。它们使 Vision‑Language Model(VLM)能够逐步收集信息——从粗粒度到细粒度视角——以更好地理解视觉丰富的信息并在海量视觉上下文中导航。

How it works

项目提供了两个主要框架:

  • VRAG:一个纯视觉 RAG 代理,使用迭代推理来收集信息。
  • VimRAG:一个利用多模态记忆图和 Graph‑Guided Policy Optimization(GGPO)的多模态推理框架。它将推理过程建模为动态有向无环图(DAG),剪枝冗余记忆节点以改进信用分配和训练收敛。

两套系统都依赖于多模态检索引擎,支持 GVE、Qwen3‑VL‑Embedding 等嵌入模型,对图像、PDF(转为图像)以及视频片段进行索引和搜索。

Who it’s for

适用于构建能够在大规模视觉数据集(图像、视频、文档)上进行复杂推理的高级多模态代理的 AI 研究者和开发者。

Highlights

  • Multi‑turn Multimodal Training:包含用于多轮多模态代理训练的强化学习框架(VRAG‑RL)。
  • Dynamic Reasoning Visualization:VimRAG 提供推理过程的实时 DAG 可视化。
  • Flexible Retrieval:支持使用最新视觉嵌入模型构建图像、PDF、视频的自定义检索器。
  • Extensible Framework:能够与多种工具配合训练,并与 vLLM 集成以实现本地模型部署。