Softlandia-Ltd/vision-is-all-you-need

Serverless Modal + FastAPI + React + ColPali + Qdrant + GPT4o Vision RAG (V-RAG) Demo

何を解決するか

このプロジェクトは、ドキュメント処理時に従来のテキストチャンク化の必要性を排除するビジュアルRAG(V-RAG)アーキテクチャを実装しています。テキストを分割するのではなく、ドキュメントページを画像として扱うことで、視覚的な構造と文脈を維持します。

動作方法

  1. 画像変換: pypdfium を使用してPDFページを画像に変換します。
  2. 視覚的埋め込み: ColPaliを含む視覚言語モデル(VLM)を用いて、これらの画像から直接埋め込みを生成します。
  3. ベクトルストレージ: これらの埋め込みはQDrantベクトルデータベースに格納されます。
  4. 検索: ユーザーがクエリを送信すると、VLMがクエリの埋め込みを生成し、データベース内の最も類似したページ画像を検索します。
  5. 生成: 検索された画像と元のクエリが、マルチモーダルモデル(GPT-4o または GPT-4o-mini)に渡され、最終的な応答が生成されます。

対象ユーザー

テキスト抽出やチャンク化の複雑さなしにドキュメントを扱えるRAGシステムを実装したい開発者やAIエンジニア。

特徴

  • チャンクフリーインデキシング: 画像から直接ベクトルとしてページを埋め込み。
  • マルチモーダルパイプライン: ColPaliによる埋め込みとGPT-4oによる最終応答生成を統合。
  • 統合スタック: Modal経由でデプロイされたバックエンドと、インタラクション用のコンパニオンフロントエンドを含む。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト