xlang-ai/Spider2

[ICLR 2025 Oral] Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows

解决的问题

Spider 2.0 是一个专为评估大型语言模型(LLMs)处理真实世界企业级文本到SQL工作流能力而设计的基准测试。与以往的基准测试不同,它聚焦于复杂的数据环境——例如包含超过3,000列的数据库——并要求模型能够跨多种SQL方言(包括BigQuery和Snowflake)工作。

如何工作

该项目提供了三种不同的评估设置,以测试不同的能力:

  • Spider 2.0-Snow:使用 Snowflake 数据库的文本到SQL任务。
  • Spider 2.0-Lite:涵盖 BigQuery、Snowflake 和 SQLite 的文本到SQL任务。
  • Spider 2.0-DBT:使用 DuckDB(DBT)的代码代理任务,专注于仓库级别的文本到SQL任务。

为便于基准测试,项目包含「Spider-Agent」框架,可通过 Docker 实现,或使用更快的工具调用版本进行快速测试。

适用对象

主要面向从事代码生成的 LLM 开发或评估的 AI 研究人员和开发者,特别是关注复杂数据库交互和企业级 SQL 工作流的群体。

亮点

  • 企业级规模:在包含数千列的庞大模式上测试模型。
  • 多方言支持:覆盖 BigQuery、Snowflake 和 SQLite。
  • 多样化的任务类型:包含标准文本到SQL任务和代理式代码生成任务(DBT)。
  • 真实世界复杂性:专门设计为比之前的基准测试(如 Spider 1.0 和 BIRD)更具挑战性。

相关