StarTrail-org/PixelRAG
The end of web parsing. The beginning of scalable pixel-native search. link: https://pixelrag.ai/
What it solves
PixelRAG 解决了传统基于文本的 Retrieval-Augmented Generation(RAG)中视觉信息的丢失。当文档被解析成文本块时,表格、图表、信息图和布局结构等关键视觉元素往往会被丢弃,使得阅读模型无法基于这些视觉数据回答问题。PixelRAG 允许用户根据文档的外观搜索和检索文档,完整保留视觉上下文。
How it works
PixelRAG 不会将文档解析为文本,而是将网页、PDF 和图像渲染为截图瓦片。随后使用专门的嵌入模型——LoRA 微调的 Qwen3-VL-Embedding——将这些图像转换为向量。这些向量存储在 FAISS 索引中,使系统能够根据查询检索最相关的视觉瓦片。阅读模型随后直接分析检索到的图像以找到答案。
Who it’s for
此工具面向开发者和 AI 研究者,构建需要处理视觉丰富文档(如技术论文或复杂网页)的 RAG 流程,也适用于 Claude Code 的用户,让他们的代理能够通过 pixelbrowse 插件“看见”并摘要网页内容。
Highlights
- Visual Retrieval: 以图像而非文本块检索文档片段,保留表格和图表。
- Pre-built Index: 提供托管的 API 和可下载的 8.28 百万篇 Wikipedia 页面 FAISS 索引。
- Versatile Rendering: 支持使用
pixelshot将 URL 和 PDF 渲染成瓦片。 - Agent Integration: 包含 Claude Code 插件(
pixelbrowse),允许代理直接截图并读取页面。 - Flexible Pipeline: 提供模块化管线,可在 Linux(CUDA)或 macOS(MPS)本地对文档进行分块、嵌入和索引。