tonywu71/colpali-cookbooks

Recipes for learning, fine-tuning, and adapting ColPali to your multimodal RAG use cases. 👨🏻‍🍳

해결하는 문제

이 프로젝트는 문서 검색을 위한 ColPali 시리즈의 시각-언어 모델(VLM)을 사용하는 실용적인 구현 가이드를 제공합니다. 전통적인 검색 시스템은 OCR과 텍스트 추출에 의존하여 레이아웃, 표, 차트와 같은 중요한 시각 정보를 상실하는 문제가 있습니다.

작동 방식

이 프로젝트는 문서 페이지를 텍스트가 아닌 이미지로 취급하는 모델인 ColPali와 ColQwen2를 사용합니다. 이러한 모델은 시각-언어 접근 방식을 통해 시각적 특징을 캡처하고 다중 벡터 임베딩을 생성합니다. 이후 쿼리와 문서 이미지 임베딩 간의 쌍별 후기 상호작용 유사도 점수를 계산하여 검색을 수행합니다.

대상 사용자

시각 기반 문서 검색을 구현하고 싶은 개발자 및 연구자, VLM을 활용한 RAG 파이프라인을 구축하고자 하는 사람, 특정 용도에 맞게 이러한 모델을 파인튜닝하고자 하는 사람.

주요 특징

  • 엔드투엔드 RAG: VRAM을 절약하기 위해 어댑터 핫스위칭 기능을 갖춘 ColQwen2를 사용한 완전한 RAG 파이프라인 구현.
  • 파인튜닝: LoRA를 사용한 ColPali 파인튜닝 가이드 및 4비트 또는 8비트 양자화 옵션.
  • 해석 가능성: 모델 예측을 시각화하고 해석할 수 있도록 유사도 맵 생성 도구.
  • 네이티브 통합: ColPali와 ColQwen2의 transformers 네이티브 구현 사용 예시.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트