tonywu71/colpali-cookbooks

Recipes for learning, fine-tuning, and adapting ColPali to your multimodal RAG use cases. 👨🏻‍🍳

解決的問題

本專案提供使用 ColPali 系列視覺語言模型(VLM)進行文件檢索的實用實作指南。解決傳統檢索系統依賴 OCR 與文字提取所導致的問題,這些方法經常會遺失版面、表格與圖表等關鍵視覺資訊。

作法原理

本專案使用 ColPali 與 ColQwen2 等模型,將文件頁面視為影像而非文字。這些模型採用視覺-語言方法來捕捉視覺特徵,並產生多向量嵌入。接著透過計算查詢與文件影像嵌入之間的成對後期互動相似度分數來執行檢索。

適用對象

對實作視覺文件檢索、使用 VLM 建構 RAG 管線,以及希望針對特定用途微調這些模型的開發者與研究人員。

主要亮點

  • 端對端 RAG:使用 ColQwen2 實作完整 RAG 管線,支援適配器熱切換以節省 VRAM。
  • 微調:提供使用 LoRA 對 ColPali 進行微調的指南,以及可選的 4 位或 8 位量化支援。
  • 可解釋性:提供生成相似度圖的工具,用於視覺化與解讀模型預測結果。
  • 原生整合:提供 ColPali 與 ColQwen2 的 transformers 原生實作使用範例。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案