xlang-ai/Spider2
[ICLR 2025 Oral] Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows
解决的问题
Spider 2.0 是一个专为评估大型语言模型(LLMs)处理真实世界企业级文本到SQL工作流能力而设计的基准测试。与以往的基准测试不同,它聚焦于复杂的数据环境——例如包含超过3,000列的数据库——并要求模型能够跨多种SQL方言(包括BigQuery和Snowflake)工作。
如何工作
该项目提供了三种不同的评估设置,以测试不同的能力:
- Spider 2.0-Snow:使用 Snowflake 数据库的文本到SQL任务。
- Spider 2.0-Lite:涵盖 BigQuery、Snowflake 和 SQLite 的文本到SQL任务。
- Spider 2.0-DBT:使用 DuckDB(DBT)的代码代理任务,专注于仓库级别的文本到SQL任务。
为便于基准测试,项目包含「Spider-Agent」框架,可通过 Docker 实现,或使用更快的工具调用版本进行快速测试。
适用对象
主要面向从事代码生成的 LLM 开发或评估的 AI 研究人员和开发者,特别是关注复杂数据库交互和企业级 SQL 工作流的群体。
亮点
- 企业级规模:在包含数千列的庞大模式上测试模型。
- 多方言支持:覆盖 BigQuery、Snowflake 和 SQLite。
- 多样化的任务类型:包含标准文本到SQL任务和代理式代码生成任务(DBT)。
- 真实世界复杂性:专门设计为比之前的基准测试(如 Spider 1.0 和 BIRD)更具挑战性。
相关
- Dispatch
- Dispatch
- 项目
- 项目
- 项目