SHITIANYU-hue/SheetasToken

Implementation and resources for Sheet as Token, a graph-enhanced framework for multi-sheet spreadsheet understanding and retrieval.

解決的問題

本專案實作一個兩階段檢索管道,旨在協助AI系統理解並從複雜的多表電子試算表中檢索相關資訊。它解決了在給定特定查詢時,僅使用表名和欄位標題等元資料(而非完整的單元格值),從大量電子試算表集合中識別出正確表格的挑戰。

工作原理

該系統分為兩個明確的階段運作:

  1. 第一階段:表標記編碼器:經過微調的BGE(BGE-base-en-v1.5)模型作為雙編碼器,將表的元資料(名稱、維度、欄位標題)序列化為標記,並檢索出最初的前50個候選表。
  2. 第二階段:圖檢索器:帶有門控的關係型圖神經網路(GNN)在候選表上執行基於查詢條件的跨表檢索。此階段透過關係組合進一步精煉選擇,以找到最相關的表。

適用對象

需要處理多表結構化資料的研究人員與開發者,適用於電子試算表理解、文件檢索以及RAG(檢索增強生成)系統開發。

主要亮點

  • 兩階段管道:結合高效的雙編碼器檢索與高精度的圖基重排序階段。
  • 僅基於元資料的方法:僅使用表ID、名稱、維度和欄位名,無需處理每個單元格的值。
  • 圖增強表示:利用GNN捕捉表之間的關係依賴性。
  • 全面的基線實作:包含凍結嵌入檢索、OpenAI LLM選擇器以及透過Ollama實作的本地LLM選擇器,用於效能對比。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案