StarTrail-org/PixelRAG

The end of web parsing. The beginning of scalable pixel-native search. link: https://pixelrag.ai/

What it solves

PixelRAG は、従来のテキストベースの Retrieval-Augmented Generation(RAG)で失われがちな視覚情報の問題を解決します。文書をテキストチャンクにパースすると、表やチャート、インフォグラフィック、レイアウト構造といった重要な視覚要素がしばしば捨てられ、リーダーモデルがその視覚データに基づいて質問に答えることができなくなります。PixelRAG は、文書の見た目に基づいて検索・取得できるようにし、視覚的コンテキストを完全に保持します。

How it works

PixelRAG は文書をテキストに変換する代わりに、ウェブページ、PDF、画像をスクリーンショットタイルにレンダリングします。その後、LoRA でファインチューニングされた Qwen3-VL-Embedding という専門の埋め込みモデルを使ってこれらの画像をベクトルに変換します。これらのベクトルは FAISS インデックスに保存され、クエリに基づいて最も関連性の高いビジュアルタイルを取得できます。リーダーモデルは取得した画像を直接解析して答えを導き出します。

Who it’s for

このツールは、技術論文や複雑なウェブページなど、視覚的にリッチな文書を扱う必要がある RAG パイプラインを構築する開発者や AI 研究者、そして pixelbrowse プラグインを通じてエージェントに「見る」能力とウェブコンテンツの要約機能を提供したい Claude Code ユーザー向けです。

Highlights

  • Visual Retrieval: テキストチャンクではなく画像として文書セグメントを取得し、表やチャートを保持します。
  • Pre-built Index: ホストされた API と、8.28 百万ページの Wikipedia の FAISS インデックスをダウンロード可能で提供します。
  • Versatile Rendering: pixelshot を使用して URL や PDF をタイルにレンダリングすることをサポートします。
  • Agent Integration: エージェントがページを直接スクリーンショットして読むことができる Claude Code プラグイン(pixelbrowse)を含みます。
  • Flexible Pipeline: Linux(CUDA)または macOS(MPS)上でローカルに文書をチャンク化、埋め込み、インデックス化するモジュラー パイプラインを提供します。