SHITIANYU-hue/SheetasToken
Implementation and resources for Sheet as Token, a graph-enhanced framework for multi-sheet spreadsheet understanding and retrieval.
何を解決するか
このプロジェクトは、複雑なマルチシートスプレッドシートから関連情報を理解し取得するのを支援する、2段階のリトリーブパイプラインを実装しています。特定のクエリに対して、セルの値ではなく、シート名やカラムヘッダーなどのメタデータのみを使用して、大規模なスプレッドシートコレクション内の正しいシートを特定するという課題に対処しています。
仕組み
システムは2つの明確な段階で動作します:
- 段階1:シートトークンエンコーダ:微調整されたBGE(BGE-base-en-v1.5)モデルがバイエンコーダとして機能し、シートメタデータ(名前、次元、カラムヘッダー)をトークンに変換し、最初の上位50件の候補シートを取得します。
- 段階2:グラフリトリーバ:ゲート付き関係型グラフニューラルネットワーク(GNN)が、候補シート上でクエリに依存するクロスシートリトリーブを実行します。この段階では、関係性の組み合わせに基づいて最も関連性の高いシートを絞り込みます。
対象ユーザー
複数のシートにまたがる構造化データを扱うスプレッドシート理解、ドキュメントリトリーブ、およびRAG(リトリーブ増強生成)システムの研究者や開発者向けです。
特徴
- 2段階パイプライン:効率的なバイエンコーダリトリーブと、高精度なグラフベースのリランキング段階を組み合わせています。
- メタデータのみのアプローチ:セルの値をすべて処理する必要なく、シートID、名前、次元、カラム名のみを使用します。
- グラフ強化表現:GNNを用いてシート間の関係的依存性を捉えます。
- 包括的なベースライン:凍結された埋め込みリトリーブ、OpenAI LLMセレクタ、およびOllama経由のローカルLLMセレクタの実装を含み、性能比較が可能です。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト