autogluon/tabarena

A Living Benchmark for Machine Learning on Tabular Data

解决的问题

TabArena 为面向表格数据的机器学习模型和系统提供了一个可靠且标准化的基准测试系统。它解决了表格机器学习模型在调优和评估过程中缺乏一致性的问题,通过采用交叉验证集成和强大的超参数搜索空间等最佳实践,确保方法在最佳状态下进行测试。

如何工作

该项目实现了一个单一代码库,支持两个不同的基准测试:

  • TabArena-v0.1:一个专注于精心筛选的独立同分布(IID)表格数据集的“活”基准。
  • BeyondArena:一个更全面的基准,测试超越 IID 的泛化能力,涵盖各种数据集大小和特征维度下的时间序列和分组任务。

它明确区分了模型(由竞技场共享协议调优的单一方法)和系统(如 AutoML 框架等完整流水线,自行处理调优和集成)。

适用人群

  • 机器学习研究人员:开发新的表格机器学习模型或基础模型,希望与现有最先进方法进行比较的人。
  • AutoML 开发者:开发 AutoML 系统(如 AutoGluon)的人,需要对其流水线进行严格的压力测试。
  • 数据科学家:希望分析元数据或在自己的数据上使用 TabArena 调优模型的人。

主要亮点

  • 全面覆盖:包含 51 个精心筛选的 IID 数据集,并扩展至 BeyondArena 的 142 个数据集。
  • 标准化协议:实现早期停止、模型重拟合、并行袋装(bagging)和内存使用量估算。
  • 详细成果物:缓存预测结果、评估结果和排行榜,支持复现和事后分析,无需重新运行完整基准测试。
  • 灵活安装:提供不同安装路径,适用于仅评估、核心基准测试或扩展模型集。

相关

  • 项目
  • 项目
  • 项目
  • 项目