Softlandia-Ltd/vision-is-all-you-need
Serverless Modal + FastAPI + React + ColPali + Qdrant + GPT4o Vision RAG (V-RAG) Demo
解決的問題
本專案實作一種視覺 RAG(V-RAG)架構,消除處理文件時對傳統文字分塊的需求。不將文字拆分成片段,而是將文件頁面視為影像,以維持視覺結構與上下文。
工作原理
- 影像轉換:使用
pypdfium將 PDF 頁面轉換為影像。 - 視覺嵌入:使用視覺語言模型(VLM),特別是 ColPali,直接從這些影像生成嵌入。
- 向量儲存:這些嵌入被儲存在 QDrant 向量資料庫中。
- 檢索:當使用者提交查詢時,VLM 會產生查詢嵌入,以在資料庫中尋找最相似的頁面影像。
- 生成:檢索到的影像與原始查詢會傳遞給多模態模型(GPT-4o 或 GPT-4o-mini)以產生最終回應。
適用對象
希望實現無需文字提取與分塊複雜性的 RAG 系統的開發者與 AI 工程師。
亮點
- 無分塊索引:直接從影像嵌入頁面為向量。
- 多模態流程:結合 ColPali 進行嵌入,GPT-4o 產生最終答案。
- 整合堆疊:包含透過 Modal 部署的後端與用於互動的配套前端。
相關
- 專案
- 專案
- 專案
- 專案