Softlandia-Ltd/vision-is-all-you-need
Serverless Modal + FastAPI + React + ColPali + Qdrant + GPT4o Vision RAG (V-RAG) Demo
解决的问题
该项目实现了一种视觉 RAG(V-RAG)架构,消除了处理文档时对传统文本分块的需求。它不将文本拆分为片段,而是将文档页面视为图像,以保持视觉结构和上下文。
工作原理
- 图像转换:使用
pypdfium将 PDF 页面转换为图像。 - 视觉嵌入:使用视觉语言模型(VLM),特别是 ColPali,直接从这些图像生成嵌入。
- 向量存储:这些嵌入被存储在 QDrant 向量数据库中。
- 检索:当用户提交查询时,VLM 生成查询嵌入,以在数据库中查找最相似的页面图像。
- 生成:检索到的图像和原始查询被传递给多模态模型(GPT-4o 或 GPT-4o-mini)以生成最终响应。
适用人群
希望实现无需文本提取和分块复杂性的 RAG 系统的开发者和 AI 工程师。
亮点
- 无分块索引:直接从图像嵌入页面为向量。
- 多模态流水线:结合 ColPali 进行嵌入,GPT-4o 生成最终答案。
- 集成堆栈:包含通过 Modal 部署的后端和用于交互的配套前端。
相关
- 项目
- 项目
- 项目
- 项目