xlang-ai/Spider2

[ICLR 2025 Oral] Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows

해결하는 문제

Spider 2.0은 대규모 기업 수준의 텍스트에서 SQL로의 워크플로우를 평가하기 위해 설계된 벤치마크입니다. 이전 벤치마크들과 달리, 3,000개 이상의 컬럼을 가진 복잡한 데이터 환경을 대상으로 하며, BigQuery 및 Snowflake와 같은 여러 SQL 다이얼렉트를 지원하는 능력을 요구합니다.

작동 방식

이 프로젝트는 다양한 능력을 테스트하기 위해 세 가지 다른 평가 설정을 제공합니다.

  • Spider 2.0-Snow: Snowflake 데이터베이스를 사용한 텍스트에서 SQL로의 작업.
  • Spider 2.0-Lite: BigQuery, Snowflake, SQLite를 아우르는 텍스트에서 SQL로의 작업.
  • Spider 2.0-DBT: DuckDB (DBT)를 사용한 코드 에이전트 작업으로, 리포지토리 수준의 텍스트에서 SQL 작업에 중점을 둡니다.

벤치마크를 용이하게 하기 위해, Docker 또는 더 빠른 도구 호출 기반 버전을 통해 구현할 수 있는 "Spider-Agent" 프레임워크가 포함되어 있습니다.

대상 사용자

주로 코드 생성을 위한 LLM을 개발하거나 평가하는 AI 연구자 및 개발자에게 적합합니다. 특히 복잡한 데이터베이스 상호작용과 기업용 SQL 워크플로우에 집중하는 분들에게 적합합니다.

주요 특징

  • 기업 규모: 수천 개의 컬럼을 가진 거대한 스키마에서 모델을 테스트합니다.
  • 다양한 다이얼렉트 지원: BigQuery, Snowflake, SQLite를 포함합니다.
  • 다양한 작업 유형: 표준 텍스트에서 SQL 작업과 에이전트 기반 코드 생성 작업(DBT)을 모두 포함합니다.
  • 현실 세계의 복잡성: Spider 1.0 및 BIRD와 같은 이전 벤치마크보다 훨씬 더 도전적인 설계를 하였습니다.

관련

  • Dispatch
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트