xlang-ai/Spider2
[ICLR 2025 Oral] Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows
解決的問題
Spider 2.0 是一個專為評估大型語言模型(LLMs)處理真實世界企業級文字轉SQL工作流程能力而設計的基準。與以往的基準不同,它聚焦於複雜的資料環境——例如包含超過 3,000 個欄位的資料庫——並要求模型能跨多種 SQL 語言(包括 BigQuery 和 Snowflake)運作。
如何運作
本專案提供三種不同的評估設定,以測試不同的能力:
- Spider 2.0-Snow:使用 Snowflake 資料庫的文字轉SQL任務。
- Spider 2.0-Lite:涵蓋 BigQuery、Snowflake 和 SQLite 的文字轉SQL任務。
- Spider 2.0-DBT:使用 DuckDB(DBT)的程式碼代理任務,專注於倉儲層級的文字轉SQL任務。
為促進基準測試,專案包含「Spider-Agent」框架,可透過 Docker 實作,或使用更快的工具呼叫版本進行快速測試。
適用對象
主要針對從事程式碼產生的 LLM 開發或評估的 AI 研究人員與開發者,特別是專注於複雜資料庫互動與企業級 SQL 工作流程的群體。
亮點
- 企業級規模:在包含數千個欄位的龐大模式上測試模型。
- 多語言支援:涵蓋 BigQuery、Snowflake 和 SQLite。
- 多樣化的任務類型:包含標準文字轉SQL任務與代理式程式碼產生任務(DBT)。
- 真實世界複雜性:專門設計為比先前的基準測試(如 Spider 1.0 和 BIRD)更具挑戰性。
相關
- Dispatch
- Dispatch
- 專案
- 專案
- 專案