soda-inria/tabicl
TabICLv2: A state-of-the-art tabular foundation model
What it solves
TabICL은 광범위한 하이퍼파라미터 튜닝 없이 테이블 데이터의 분류와 회귀 문제를 해결하도록 설계되었습니다. XGBoost, CatBoost, LightGBM과 같은 기존의 그래디언트 부스팅 결정 트리(GBDT)를 대체하는 최첨단 옵션을 제공하며, 특히 300개에서 100,000개의 학습 샘플을 가진 데이터셋에 적합합니다.
How it works
TabICL은 Transformer 아키텍처를 기반으로 한 테이블 기초 모델입니다. 인컨텍스트 학습(ICL)을 사용하여 사전 학습된 Transformer에 단 한 번의 포워드 패스를 수행함으로써 새로운 데이터에 대해 동시에 피팅 및 예측을 수행합니다. 수백만 개의 합성 데이터셋으로 사전 학습되어 일반적인 학습 능력을 갖추고 있습니다. 특정 데이터셋에 대한 성능을 향상시키기 위해 전체 PyTorch 학습 루프를 통한 파인튜닝도 지원합니다.
Who it’s for
빠르게 배포할 수 있고 scikit-learn 호환성을 갖춘 고정밀 테이블 모델을 원하는 데이터 과학자 및 ML 엔지니어, 그리고 테이블 기초 모델과 인컨텍스트 학습에 관심이 있는 연구자를 위한 모델입니다.
Highlights
- Zero-shot performance: 약 80%의 TabArena 데이터셋에서 튜닝된 GBDT를 능가하는 성능을 튜닝 없이 제공.
- Scalability: 최대 100,000개의 학습 샘플과 2,000개의 피처를 가진 데이터셋을 지원하며, CPU 및 디스크 오프로드를 통해 더 큰 데이터셋도 처리 가능.
- Speed: 특정 벤치마크에서 TabPFN-2.5보다 최대 10배 빠르며, KV 캐싱을 통해 반복 추론 속도를 높임.
- Versatility: 분류, 회귀, zero-shot 시계열 예측을 지원.
- Explainability: SHAP와 통합되어 피처 중요도 분석 가능.
- Open Source: 사전 학습 코드와 합성 데이터 생성 레시피 포함.