tonywu71/colpali-cookbooks

Recipes for learning, fine-tuning, and adapting ColPali to your multimodal RAG use cases. 👨🏻‍🍳

何を解決するか

このプロジェクトは、ドキュメント検索に向けたColPaliシリーズの視覚言語モデル(VLM)の実装ガイドを提供します。従来の検索システムがOCRとテキスト抽出に依存するため、レイアウト、表、チャートなどの重要な視覚情報を失うという課題に対処しています。

動作方法

ColPaliやColQwen2などのモデルを使用し、ドキュメントページをテキストではなく画像として扱います。これらのモデルは視覚言語アプローチにより視覚的特徴を捉え、マルチベクトル埋め込みを生成します。その後、クエリとドキュメント画像の埋め込み間のペアワイズ後期相互作用類似度スコアを計算することで検索を実行します。

対象読者

視覚ベースのドキュメント検索の実装、VLMを用いたRAGパイプラインの構築、特定の用途向けにこれらのモデルをファインチューニングしたい開発者や研究者。

特徴

  • エンドツーエンドRAG: VRAMを節約するためのアダプターホットスイッチ機能を備えたColQwen2を用いた完全なRAGパイプラインの実装。
  • ファインチューニング: LoRAを用いたColPaliのファインチューニングガイドおよび4ビットまたは8ビット量子化のオプション。
  • 解釈可能性: モデルの予測を視覚化・解釈するための類似度マップ生成ツール。
  • ネイティブ統合: ColPaliおよびColQwen2のtransformersネイティブ実装の使用例。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト