Softlandia-Ltd/vision-is-all-you-need

Serverless Modal + FastAPI + React + ColPali + Qdrant + GPT4o Vision RAG (V-RAG) Demo

해결하는 문제

이 프로젝트는 문서 처리 시 기존의 텍스트 청크화의 필요성을 제거하는 비전 기반 RAG(V-RAG) 아키텍처를 구현합니다. 텍스트를 나누는 대신 문서 페이지를 이미지로 취급하여 시각적 구조와 맥락을 유지합니다.

작동 방식

  1. 이미지 변환: pypdfium을 사용하여 PDF 페이지를 이미지로 변환합니다.
  2. 시각적 임베딩: ColPali를 포함한 비전 언어 모델(VLM)을 사용해 이러한 이미지에서 직접 임베딩을 생성합니다.
  3. 벡터 저장: 이 임베딩은 QDrant 벡터 데이터베이스에 저장됩니다.
  4. 검색: 사용자가 쿼리를 제출하면 VLM이 쿼리 임베딩을 생성하여 데이터베이스에서 가장 유사한 페이지 이미지를 찾습니다.
  5. 생성: 검색된 이미지와 원본 쿼리는 다중모달 모델(GPT-4o 또는 GPT-4o-mini)에 전달되어 최종 응답을 생성합니다.

대상 사용자

텍스트 추출 및 청크화의 복잡성 없이 문서를 처리할 수 있는 RAG 시스템을 구현하고자 하는 개발자 및 AI 엔지니어.

주요 특징

  • 청크 없는 인덱싱: 이미지에서 직접 페이지를 벡터로 임베딩.
  • 다중모달 파이프라인: ColPali로 임베딩 생성 및 GPT-4o로 최종 응답 생성 통합.
  • 통합 스택: Modal을 통해 배포된 백엔드와 상호작용을 위한 커플러 프론트엔드 포함.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트