Alibaba-NLP/VRAG

Multimodal Retrieval-augmented Generation Framework Built by Tongyi Lab, Alibaba Group.

What it solves

VRAG と VimRAG は、テキスト、画像、動画にまたがるマルチモーダル Retrieval‑Augmented Generation(RAG)の課題に取り組みます。これらは Vision‑Language Model(VLM)に対し、粗い視点から細かい視点へと情報を段階的に収集させ、視覚的にリッチな情報をより深く理解し、膨大なビジュアルコンテキストをナビゲートできるようにします。

How it works

本プロジェクトは 2 つの主要フレームワークを提供します。

  • VRAG: 反復的推論を用いて情報を収集する、純粋ビジュアル RAG エージェント。
  • VimRAG: マルチモーダルメモリグラフと Graph‑Guided Policy Optimization(GGPO)を活用したマルチモーダル推論フレームワーク。推論プロセスを動的有向非循環グラフ(DAG)としてモデル化し、冗長なメモリノードを剪定してクレジット割り当てと学習収束を改善します。

両システムは、GVE や Qwen3‑VL‑Embedding などの埋め込みモデルを用いて画像、PDF(画像に変換)および動画チャンクをインデックス化・検索できるマルチモーダル検索エンジンに依存しています。

Who it’s for

大規模なビジュアルデータセット(画像、動画、文書)に対して高度な推論を行えるマルチモーダルエージェントを構築したい AI 研究者・開発者向けです。

Highlights

  • Multi‑turn Multimodal Training: 強化学習を用いたマルチターンマルチモーダルエージェント訓練用フレームワーク(VRAG‑RL)を含みます。
  • Dynamic Reasoning Visualization: VimRAG は推論プロセスをリアルタイムで DAG 可視化します。
  • Flexible Retrieval: 最先端のビジュアル埋め込みモデルを使用して、画像、PDF、動画用のカスタムリトリーバを構築可能です。
  • Extensible Framework: 各種ツールでの訓練をサポートし、ローカルモデルデプロイのために vLLM と統合できます。