Alibaba-NLP/VRAG

Multimodal Retrieval-augmented Generation Framework Built by Tongyi Lab, Alibaba Group.

What it solves

VRAG 與 VimRAG 解決了跨文本、圖像與影片的多模態 Retrieval‑Augmented Generation(RAG)挑戰。它們使 Vision‑Language Model(VLM)能夠逐步收集資訊——從粗粒度到細粒度視角——以更好地理解視覺豐富的資訊,並在龐大的視覺上下文中導航。

How it works

本專案提供兩個主要框架:

  • VRAG:純視覺 RAG 代理,使用迭代推理來收集資訊。
  • VimRAG:利用多模態記憶圖與 Graph‑Guided Policy Optimization(GGPO)的多模態推理框架。它將推理過程建模為動態有向無環圖(DAG),剪枝冗餘記憶節點以改進信用分配與訓練收斂。

兩套系統皆依賴多模態檢索引擎,支援 GVE、Qwen3‑VL‑Embedding 等嵌入模型,對圖像、PDF(轉為圖像)以及影片片段進行索引與搜尋。

Who it’s for

適用於構建能在大規模視覺資料集(圖像、影片、文件)上進行複雜推理的高階多模態代理的 AI 研究者與開發者。

Highlights

  • Multi‑turn Multimodal Training:包含用於多回合多模態代理訓練的強化學習框架(VRAG‑RL)。
  • Dynamic Reasoning Visualization:VimRAG 提供推理過程的即時 DAG 可視化。
  • Flexible Retrieval:支援使用最新視覺嵌入模型建構圖像、PDF、影片的自訂檢索器。
  • Extensible Framework:能與各種工具配合訓練,並與 vLLM 整合以實現本地模型部署。