autogluon/tabarena

A Living Benchmark for Machine Learning on Tabular Data

何を解決するか

TabArenaは、表形式の機械学習モデルやシステム向けに信頼性があり標準化されたベンチマークシステムを提供します。表形式MLモデルのチューニングや評価における一貫性の欠如という課題に対処し、クロスバリデーションによるアンサンブルや強力なハイパーパラメータ探索空間といったベストプラクティスを用いて、各手法が最大限の性能を発揮できる状態でテストされるようにしています。

動作方法

このプロジェクトは、単一のコードベースを用いて2つの異なるベンチマークを実装しています。

  • TabArena-v0.1: 極めて選別された独立同分布(IID)の表形式データセットに焦点を当てた「生きている」ベンチマーク。
  • BeyondArena: IIDを超える一般化能力をテストするより包括的なベンチマーク。時間的・グループ化されたタスクを、さまざまなデータセットサイズや特徴次元数にわたってカバーしています。

モデル(アリーナの共有プロトコルでチューニングされる単一の手法)とシステム(AutoMLフレームワークなど、独自のチューニングとアンサンブルを処理する完全なパイプライン)の区別を明確にしています。

対象ユーザー

  • 機械学習研究者: 新しい表形式MLモデルや基礎モデルを開発している人で、既存の最先端手法と比較したい人。
  • AutoML開発者: AutoGluonなど、パイプラインの厳密なストレステストが必要なAutoMLシステムの開発者。
  • データサイエンティスト: メタデータを分析したり、TabArenaでチューニングされたモデルを自らのデータに適用したい人。

主な特徴

  • 包括的なカバレッジ: 51の選別されたIIDデータセットを含み、BeyondArenaでは142のデータセットに拡張。
  • 標準化プロトコル: 早期停止、モデルの再適合、並列バギング、メモリ使用量の推定を実装。
  • 詳細なアーティファクト: 予測結果、結果、リーダーボードをキャッシュし、フルベンチマークの再実行なしに再現性や後処理分析が可能。
  • 柔軟なインストール: 評価専用、コアベンチマーク、拡張モデルセットのための異なるインストールパスを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト