StarTrail-org/PixelRAG
The end of web parsing. The beginning of scalable pixel-native search. link: https://pixelrag.ai/
What it solves
PixelRAG는 기존 텍스트 기반 Retrieval-Augmented Generation(RAG)에서 시각 정보가 손실되는 문제를 해결합니다. 문서를 텍스트 청크로 파싱하면 표, 차트, 인포그래픽, 레이아웃 구조와 같은 중요한 시각 요소가 종종 버려져, 리더 모델이 해당 시각 데이터를 기반으로 질문에 답할 수 없게 됩니다. PixelRAG는 문서의 외관을 기준으로 검색하고 가져올 수 있게 하여 전체 시각 컨텍스트를 보존합니다.
How it works
PixelRAG는 문서를 텍스트로 파싱하는 대신 웹 페이지, PDF, 이미지를 스크린샷 타일로 렌더링합니다. 그런 다음 LoRA‑fine‑tuned Qwen3-VL-Embedding이라는 특수 임베딩 모델을 사용해 이러한 이미지를 벡터로 변환합니다. 이 벡터들은 FAISS 인덱스에 저장되어 쿼리에 따라 가장 관련성 높은 시각 타일을 검색할 수 있게 합니다. 리더 모델은 검색된 이미지를 직접 분석해 답을 찾습니다.
Who it’s for
이 도구는 기술 논문이나 복잡한 웹 페이지와 같이 시각적으로 풍부한 문서를 다루어야 하는 RAG 파이프라인을 구축하는 개발자와 AI 연구자, 그리고 pixelbrowse 플러그인을 통해 에이전트가 웹 콘텐츠를 "볼" 수 있고 요약할 수 있게 하고 싶은 Claude Code 사용자에게 적합합니다.
Highlights
- Visual Retrieval: 텍스트 청크가 아니라 이미지로 문서 세그먼트를 검색하여 표와 차트를 보존합니다.
- Pre-built Index: 호스팅된 API와 8.28백만 개 위키피디아 페이지의 FAISS 인덱스를 다운로드 형태로 제공합니다.
- Versatile Rendering:
pixelshot을 사용해 URL 및 PDF를 타일로 렌더링하는 기능을 지원합니다. - Agent Integration: 에이전트가 페이지를 직접 스크린샷하고 읽을 수 있게 하는 Claude Code 플러그인(
pixelbrowse)을 포함합니다. - Flexible Pipeline: Linux(CUDA) 또는 macOS(MPS)에서 로컬로 문서를 청크화, 임베딩, 인덱싱할 수 있는 모듈식 파이프라인을 제공합니다.