StarTrail-org/PixelRAG

The end of web parsing. The beginning of scalable pixel-native search. link: https://pixelrag.ai/

What it solves

PixelRAG 解決了傳統文字型 Retrieval-Augmented Generation(RAG)中視覺資訊的流失。當文件被解析成文字片段時,表格、圖表、資訊圖與版面結構等關鍵視覺元素往往會被捨棄,使得讀取模型無法根據這些視覺資料回答問題。PixelRAG 允許使用者依照文件的外觀搜尋與檢索文件,完整保留視覺上下文。

How it works

PixelRAG 不會將文件解析成文字,而是將網頁、PDF 與影像渲染成螢幕截圖瓦片。接著使用專門的嵌入模型——LoRA 微調的 Qwen3-VL-Embedding——將這些影像轉換為向量。這些向量儲存在 FAISS 索引中,使系統能根據查詢檢索最相關的視覺瓦片。讀取模型隨後直接分析檢索到的影像以找出答案。

Who it’s for

此工具適用於開發者與 AI 研究者,構建需要處理視覺豐富文件(如技術論文或複雜網頁)的 RAG 流程,也適合 Claude Code 使用者,讓他們的代理人能透過 pixelbrowse 插件「看見」並摘要網頁內容。

Highlights

  • Visual Retrieval: 以影像而非文字片段檢索文件段落,保留表格與圖表。
  • Pre-built Index: 提供託管的 API 與可下載的 8.28 百萬篇 Wikipedia 頁面的 FAISS 索引。
  • Versatile Rendering: 支援使用 pixelshot 將 URL 與 PDF 渲染成瓦片。
  • Agent Integration: 包含 Claude Code 插件(pixelbrowse),讓代理人直接截圖並閱讀頁面。
  • Flexible Pipeline: 提供模組化管線,可在 Linux(CUDA)或 macOS(MPS)本地進行文件的分塊、嵌入與索引。