LAMDA-Tabular/TALENT

A comprehensive toolkit and benchmark for tabular data learning, featuring 35+ deep methods, more than 10 classical methods, and 300 diverse tabular datasets.

해결하는 문제

TALENT은 테이블 데이터에서 모델 성능을 최적화하는 과제를 해결하기 위해 통합된 벤치마크와 포괄적인 머신러닝 도구상자를 제공합니다. 전통적인 트리 기반 방법에서부터 최신의 딥러닝 및 패러다임 모델에 이르기까지 다양한 알고리즘을 방대한 데이터셋에서 비교하는 과정을 단순화합니다.

작동 방식

TALENT은 45개 이상의 다양한 테이블 학습 방법을 하나의 프레임워크에 통합합니다. 표준화된 전처리(정규화 및 인코딩), 하이퍼파라미터 튜닝, 평가를 위한 도구를 제공합니다. 다음과 같은 다양한 아키텍처를 지원합니다:

  • 딥러닝: MLP, ResNets, 그리고 FT-Transformer 및 TabTransformer와 같은 토큰 기반 방법.
  • 트리 모방 모델: NODE, TabNet, GRANDE.
  • 테이블 기반 패러다임 모델: TabPFN(v1~v3), TabICL, Google의 TabFM. 이들은 컨텍스트 기반 학습을 활용하여 제로샷 또는 희소샷 예측을 수행합니다.
  • 특화 알고리즘: 백프로파게이션 없이 특징을 학습하는 RFM 및 xRFM.

대상 사용자

테이블 데이터용 최신 머신러닝 모델을 평가, 벤치마크, 구현해야 하는 데이터 과학자(초보자부터 전문가까지)를 위한 것입니다.

주요 특징

  • 대규모 메서드 라이브러리: 30개 이상의 딥러닝 아키텍처와 다양한 전통적 및 트리 기반 방법 포함.
  • 광범위한 벤치마크: 다양한 작업 유형, 크기, 도메인을 커버하는 300개 이상의 데이터셋을 포함.
  • 패러다임 모델 지원: TabPFN 및 TabFM과 같은 최신 테이블 기반 패러다임 모델에 통합된 지원.
  • 사용자 친화적 파이프라인: 하이퍼파라미터 탐색 공간, 결정 임계값 튜닝, 캘리브레이션 지표(Brier, ECE)를 내장 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트