autogluon/tabarena
A Living Benchmark for Machine Learning on Tabular Data
解決的問題
TabArena 為面向表格資料的機器學習模型與系統提供一個可靠且標準化的基準測試系統。它解決了表格機器學習模型在調校與評估過程中缺乏一致性之問題,透過採用交叉驗證集成與強大的超參數搜尋空間等最佳實務,確保方法在最佳狀態下進行測試。
如何運作
此專案實作單一程式碼庫,支援兩個不同的基準測試:
- TabArena-v0.1:一個專注於精心篩選的獨立同分佈(IID)表格資料集的「活」基準。
- BeyondArena:一個更全面的基準,測試超越 IID 的泛化能力,涵蓋各種資料集大小與特徵維度下的時間序列與分組任務。
它明確區分模型(由競技場共享協定調校的單一方法)與系統(如 AutoML 框架等完整流程,自行處理調校與集成)。
適用對象
- 機器學習研究人員:開發新的表格機器學習模型或基礎模型,希望與現有最先進方法進行比較的人。
- AutoML 開發者:開發 AutoML 系統(如 AutoGluon)的人,需要對其流程進行嚴格壓力測試。
- 資料科學家:希望分析元資料或在自己的資料上使用 TabArena 調校模型的人。
主要亮點
- 全面覆蓋:包含 51 個精心篩選的 IID 資料集,並擴展至 BeyondArena 的 142 個資料集。
- 標準化協定:實作早期停止、模型重擬合、並行袋裝(bagging)與記憶體使用量估算。
- 詳細成果物:快取預測結果、評估結果與排行榜,支援重現與事後分析,無需重新執行完整基準測試。
- 彈性安裝:提供不同安裝路徑,適用於僅評估、核心基準測試或擴展模型集。
相關
- 專案
- 專案
- 專案
- 專案