autogluon/tabarena

A Living Benchmark for Machine Learning on Tabular Data

해결하는 문제

TabArena는 표 형식의 기계학습 모델 및 시스템을 위한 신뢰할 수 있고 표준화된 벤치마킹 시스템을 제공합니다. 표 형식 ML 모델의 튜닝 및 평가 방식에 대한 일관성 부족 문제를 해결하며, 교차 검증 앙상블 및 강력한 하이퍼파라미터 탐색 공간과 같은 최선의 실천 방안을 사용하여 각 방법이 최대 성능을 발휘할 수 있도록 테스트합니다.

작동 방식

이 프로젝트는 단일 코드베이스를 사용하여 두 가지 다른 벤치마크를 구현합니다.

  • TabArena-v0.1: 엄선된 독립적이고 동일한 분포(IID) 표 형식 데이터셋에 초점을 맞춘 '살아있는' 벤치마크입니다.
  • BeyondArena: IID를 넘어서는 일반화 능력을 테스트하는 더 포괄적인 벤치마크로, 다양한 데이터셋 크기와 특징 차원 수에 걸쳐 시간적 및 그룹화된 작업을 다룹니다.

모델(아리나의 공유 프로토콜로 튜닝되는 단일 방법)과 시스템(자체 튜닝 및 앙상블을 처리하는 완전한 파이프라인인 AutoML 프레임워크 등)을 명확히 구분합니다.

대상 사용자

  • ML 연구자: 새로운 표 형식 ML 모델이나 기초 모델을 개발하고 기존 최첨단 방법과 비교하고 싶은 사람.
  • AutoML 개발자: AutoGluon과 같은 AutoML 시스템을 개발하고 있으며, 파이프라인에 대한 엄격한 스트레스 테스트가 필요한 사람.
  • 데이터 과학자: 메타데이터를 분석하거나 TabArena로 튜닝된 모델을 자신의 데이터에 사용하고 싶은 사람.

주요 특징

  • 포괄적인 커버리지: 51개의 엄선된 IID 데이터셋을 포함하며, BeyondArena에서는 142개의 데이터셋으로 확장됩니다.
  • 표준화된 프로토콜: 조기 중단, 모델 재적합, 병렬 배깅, 메모리 사용량 추정을 구현합니다.
  • 세부 아티팩트: 예측 결과, 결과, 리더보드를 캐시하여 전체 벤치마크를 다시 실행하지 않고도 재현성과 사후 분석이 가능합니다.
  • 유연한 설치: 평가 전용, 핵심 벤치마킹, 확장된 모델 세트를 위한 다양한 설치 경로를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트