SHITIANYU-hue/SheetasToken
Implementation and resources for Sheet as Token, a graph-enhanced framework for multi-sheet spreadsheet understanding and retrieval.
解决的问题
本项目实现了一个两阶段检索管道,旨在帮助AI系统理解并从复杂的多表单电子表格中检索相关信息。它解决了在给定特定查询时,仅使用表名和列标题等元数据(而非完整的单元格值),从大量电子表格集合中识别出正确表格的挑战。
工作原理
该系统分为两个明确的阶段运行:
- 第一阶段:表标记编码器:经过微调的BGE(BGE-base-en-v1.5)模型作为双编码器,将表的元数据(名称、维度、列标题)序列化为标记,并检索出最初的前50个候选表。
- 第二阶段:图检索器:带有门控的关系型图神经网络(GNN)在候选表上执行基于查询条件的跨表检索。此阶段通过关系组合进一步精炼选择,以找到最相关的表。
适用人群
需要处理多表结构化数据的研究人员和开发者,适用于电子表格理解、文档检索以及RAG(检索增强生成)系统开发。
主要亮点
- 两阶段管道:结合高效的双编码器检索与高精度的图基重排序阶段。
- 仅基于元数据的方法:仅使用表ID、名称、维度和列名,无需处理每个单元格的值。
- 图增强表示:利用GNN捕捉表之间的关系依赖性。
- 全面的基线实现:包含冻结嵌入检索、OpenAI LLM选择器以及通过Ollama实现的本地LLM选择器,用于性能对比。
相关
- 项目
- 项目
- 项目
- 项目
- 项目