SHITIANYU-hue/SheetasToken

Implementation and resources for Sheet as Token, a graph-enhanced framework for multi-sheet spreadsheet understanding and retrieval.

何を解決するか

このプロジェクトは、複雑なマルチシートスプレッドシートから関連情報を理解し取得するのを支援する、2段階のリトリーブパイプラインを実装しています。特定のクエリに対して、セルの値ではなく、シート名やカラムヘッダーなどのメタデータのみを使用して、大規模なスプレッドシートコレクション内の正しいシートを特定するという課題に対処しています。

仕組み

システムは2つの明確な段階で動作します:

  1. 段階1:シートトークンエンコーダ:微調整されたBGE(BGE-base-en-v1.5)モデルがバイエンコーダとして機能し、シートメタデータ(名前、次元、カラムヘッダー)をトークンに変換し、最初の上位50件の候補シートを取得します。
  2. 段階2:グラフリトリーバ:ゲート付き関係型グラフニューラルネットワーク(GNN)が、候補シート上でクエリに依存するクロスシートリトリーブを実行します。この段階では、関係性の組み合わせに基づいて最も関連性の高いシートを絞り込みます。

対象ユーザー

複数のシートにまたがる構造化データを扱うスプレッドシート理解、ドキュメントリトリーブ、およびRAG(リトリーブ増強生成)システムの研究者や開発者向けです。

特徴

  • 2段階パイプライン:効率的なバイエンコーダリトリーブと、高精度なグラフベースのリランキング段階を組み合わせています。
  • メタデータのみのアプローチ:セルの値をすべて処理する必要なく、シートID、名前、次元、カラム名のみを使用します。
  • グラフ強化表現:GNNを用いてシート間の関係的依存性を捉えます。
  • 包括的なベースライン:凍結された埋め込みリトリーブ、OpenAI LLMセレクタ、およびOllama経由のローカルLLMセレクタの実装を含み、性能比較が可能です。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト