Softlandia-Ltd/vision-is-all-you-need

Serverless Modal + FastAPI + React + ColPali + Qdrant + GPT4o Vision RAG (V-RAG) Demo

解決的問題

本專案實作一種視覺 RAG(V-RAG)架構,消除處理文件時對傳統文字分塊的需求。不將文字拆分成片段,而是將文件頁面視為影像,以維持視覺結構與上下文。

工作原理

  1. 影像轉換:使用 pypdfium 將 PDF 頁面轉換為影像。
  2. 視覺嵌入:使用視覺語言模型(VLM),特別是 ColPali,直接從這些影像生成嵌入。
  3. 向量儲存:這些嵌入被儲存在 QDrant 向量資料庫中。
  4. 檢索:當使用者提交查詢時,VLM 會產生查詢嵌入,以在資料庫中尋找最相似的頁面影像。
  5. 生成:檢索到的影像與原始查詢會傳遞給多模態模型(GPT-4o 或 GPT-4o-mini)以產生最終回應。

適用對象

希望實現無需文字提取與分塊複雜性的 RAG 系統的開發者與 AI 工程師。

亮點

  • 無分塊索引:直接從影像嵌入頁面為向量。
  • 多模態流程:結合 ColPali 進行嵌入,GPT-4o 產生最終答案。
  • 整合堆疊:包含透過 Modal 部署的後端與用於互動的配套前端。

相關

  • 專案
  • 專案
  • 專案
  • 專案