SHITIANYU-hue/SheetasToken
Implementation and resources for Sheet as Token, a graph-enhanced framework for multi-sheet spreadsheet understanding and retrieval.
해결하는 문제
이 프로젝트는 복잡한 다중 시트 스프레드시트에서 관련 정보를 이해하고 검색하는 데 도움을 주기 위한 이단계 검색 파이프라인을 구현합니다. 셀의 전체 값이 아닌 시트 이름과 열 헤더와 같은 메타데이터만을 사용하여, 특정 쿼리에 대해 대규모 스프레드시트 컬렉션 내에서 올바른 시트를 식별하는 문제를 해결합니다.
작동 방식
시스템은 두 가지 명확한 단계로 작동합니다:
- 단계 1: 시트 토큰 인코더: 미세 조정된 BGE(BGE-base-en-v1.5) 모델이 양방향 인코더 역할을 하여 시트 메타데이터(이름, 차원, 열 헤더)를 토큰으로 변환하고, 처음으로 상위 50개의 후보 시트를 검색합니다.
- 단계 2: 그래프 리트리버: 게이트형 관계형 그래프 신경망(GNN)이 후보 시트들 위에서 쿼리 조건부 크로스시트 검색을 수행합니다. 이 단계에서는 관계적 조합을 기반으로 가장 관련성이 높은 시트를 정밀하게 추출합니다.
대상 사용자
다중 시트에 걸쳐 구조화된 데이터를 처리해야 하는 스프레드시트 이해, 문서 검색, RAG(Retrieval-Augmented Generation) 시스템을 개발하는 연구자 및 개발자에게 적합합니다.
주요 특징
- 이단계 파이프라인: 효율적인 양방향 인코더 검색과 고정밀 그래프 기반 재정렬 단계를 결합합니다.
- 메타데이터 중심 접근법: 모든 셀 값을 처리할 필요 없이 시트 ID, 이름, 차원, 열 이름만 사용합니다.
- 그래프 강화 표현: GNN을 활용해 시트 간의 관계적 의존성을 포착합니다.
- 포괄적인 베이스라인: 동결된 임베딩 검색, OpenAI LLM 선택기, Ollama를 통한 로컬 LLM 선택기의 구현이 포함되어 성능 비교가 가능합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트