HKUDS/RAG-Anything

"RAG-Anything: All-in-One RAG Framework"

何を解決するか

従来のRAGシステムは主にテキストに焦点を当てており、画像、表、数式を含む混合コンテンツを処理するのに苦労します。RAG-Anythingは、複数の専門ツールを必要とせずに、単一のシステム内ですべてのモダリティ(テキスト、画像、表、数式)をシームレスに処理・検索できる、ワンストップのフレームワークを提供します。

動作方法

LightRAGを基盤とするマルチステージのマルチモーダルパイプラインを実装しています:

  1. ドキュメント解析:PDF、Office文書、画像からテキスト、視覚的要素、表を高忠実度で抽出するためにMinerUを使用します。
  2. コンテンツ分析:コンテンツを自動的に分類し、専用のアナライザー(例:画像用のVisual Content Analyzer、表用のStructured Data Interpreter、LaTeX式用のMathematical Expression Parser)にルーティングします。
  3. 知識グラフインデックス化:マルチモーダル要素を構造化されたエンティティに変換し、モダリティ間の関係をマッピングすることで、元のドキュメントの階層構造を保持します。
  4. モダリティ対応検索:ベクトル類似性検索とグラフ走査を組み合わせ、クエリのモダリティの好みに応じて適応的なランク付けで結果を重み付けしてコンテンツを取得します。

対象ユーザー

このツールは、豊富な混合コンテンツを含むドキュメントを扱うユーザー向けに設計されています。特に学術研究、技術文書、財務報告、企業の知識管理に該当します。

特徴

  • エンドツーエンドのパイプライン:インジェストから解析、マルチモーダルクエリ応答までを一貫して処理します。
  • ユニバーサルフォーマット対応:PDF、Officeファイル(DOCX、PPTX、XLSX)、画像を処理できます。
  • マルチモーダル知識グラフ:エンティティを自動抽出し、異なるコンテンツタイプ間の関係を発見します。
  • VLM強化クエリ:視覚言語モデル(VLM)を統合し、画像とテキストの文脈を同時に分析してより深いインサイトを提供します。
  • ハイブリッド検索:ベクトル検索とグラフ走査を融合し、より包括的な情報回復を実現します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト