Softlandia-Ltd/vision-is-all-you-need

Serverless Modal + FastAPI + React + ColPali + Qdrant + GPT4o Vision RAG (V-RAG) Demo

解决的问题

该项目实现了一种视觉 RAG(V-RAG)架构,消除了处理文档时对传统文本分块的需求。它不将文本拆分为片段,而是将文档页面视为图像,以保持视觉结构和上下文。

工作原理

  1. 图像转换:使用 pypdfium 将 PDF 页面转换为图像。
  2. 视觉嵌入:使用视觉语言模型(VLM),特别是 ColPali,直接从这些图像生成嵌入。
  3. 向量存储:这些嵌入被存储在 QDrant 向量数据库中。
  4. 检索:当用户提交查询时,VLM 生成查询嵌入,以在数据库中查找最相似的页面图像。
  5. 生成:检索到的图像和原始查询被传递给多模态模型(GPT-4o 或 GPT-4o-mini)以生成最终响应。

适用人群

希望实现无需文本提取和分块复杂性的 RAG 系统的开发者和 AI 工程师。

亮点

  • 无分块索引:直接从图像嵌入页面为向量。
  • 多模态流水线:结合 ColPali 进行嵌入,GPT-4o 生成最终答案。
  • 集成堆栈:包含通过 Modal 部署的后端和用于交互的配套前端。

相关

  • 项目
  • 项目
  • 项目
  • 项目