Alibaba-NLP/VRAG
Multimodal Retrieval-augmented Generation Framework Built by Tongyi Lab, Alibaba Group.
What it solves
VRAG 與 VimRAG 解決了跨文本、圖像與影片的多模態 Retrieval‑Augmented Generation(RAG)挑戰。它們使 Vision‑Language Model(VLM)能夠逐步收集資訊——從粗粒度到細粒度視角——以更好地理解視覺豐富的資訊,並在龐大的視覺上下文中導航。
How it works
本專案提供兩個主要框架:
- VRAG:純視覺 RAG 代理,使用迭代推理來收集資訊。
- VimRAG:利用多模態記憶圖與 Graph‑Guided Policy Optimization(GGPO)的多模態推理框架。它將推理過程建模為動態有向無環圖(DAG),剪枝冗餘記憶節點以改進信用分配與訓練收斂。
兩套系統皆依賴多模態檢索引擎,支援 GVE、Qwen3‑VL‑Embedding 等嵌入模型,對圖像、PDF(轉為圖像)以及影片片段進行索引與搜尋。
Who it’s for
適用於構建能在大規模視覺資料集(圖像、影片、文件)上進行複雜推理的高階多模態代理的 AI 研究者與開發者。
Highlights
- Multi‑turn Multimodal Training:包含用於多回合多模態代理訓練的強化學習框架(VRAG‑RL)。
- Dynamic Reasoning Visualization:VimRAG 提供推理過程的即時 DAG 可視化。
- Flexible Retrieval:支援使用最新視覺嵌入模型建構圖像、PDF、影片的自訂檢索器。
- Extensible Framework:能與各種工具配合訓練,並與 vLLM 整合以實現本地模型部署。