OpenBMB/VisRAG

Parsing-free RAG supported by VLMs

何を解決するか

VisRAGは、従来の検索拡張生成(RAG)でドキュメントをテキストにパースする際に発生する情報損失に対処します。ドキュメントをテキストではなく画像として扱うことで、元のレイアウトや視覚データを保持し、検索および生成プロセス中の情報保持を最大化します。

動作方法

このシステムは、3つの主要なコンポーネントからなる視覚言語モデル(VLM)パイプラインで動作します。

  1. VisRAG-Ret(リトリーバー): ドキュメントを直接画像として埋め込むドキュメント埋め込みモデルで、クエリに基づいて関連する視覚ページを検索します。
  2. VisRAG-Gen(ジェネレーター): 検索された画像に基づいて回答を生成するVLM(GPT-4oやMiniCPM-Vなど)。
  3. EVisRAG(VisRAG 2.0): 多画像推論を向上させる高度なエンドツーエンドフレームワーク。4段階のプロセス——画像の観察、証拠の記録、推論、回答——を用い、視覚的認識と推論を同時に最適化するため、Reward-Scoped Group Relative Policy Optimization(RS-GRPO)で訓練されています。

対象ユーザー

視覚的レイアウト、チャート、画像が回答に不可欠な複雑なドキュメント(PDFなど)を扱う開発者や研究者。

特徴

  • 視覚最優先のRAG: ドキュメントを画像として埋め込むことで、パースに起因する情報損失を排除。
  • 証拠に基づく推論: EVisRAGは、最終的な推論の前に各画像の証拠を構造的に収集するアプローチを採用。
  • RS-GRPO訓練: 視覚的認識と推論を同時に最適化する専用の強化学習アルゴリズムを採用。
  • 多画像対応: 複数の検索された視覚ドキュメント間での推論を必要とする質問に特に設計されています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト