soda-inria/tabicl

TabICLv2: A state-of-the-art tabular foundation model

What it solves

TabICL 旨在解決表格資料分類與回歸的挑戰,無需大量超參數調整。它提供了一種最先進的替代方案,取代傳統的梯度提升決策樹(GBDT)如 XGBoost、CatBoost 或 LightGBM,特別適用於訓練樣本數介於 300 到 100,000 之間的資料集。

How it works

TabICL 是基於 Transformer 架構的表格基礎模型。它使用情境學習(ICL),模型只需對預訓練好的 Transformer 進行一次前向傳播,即可同時在新資料上完成擬合與預測。模型在數百萬個合成資料集上進行預訓練,以獲得通用的學習能力。為了提升在特定資料集上的表現,亦支援完整的 PyTorch 訓練迴圈進行微調。

Who it’s for

此模型適合希望取得高精度、易部署且符合 scikit‑learn 標準的表格模型的資料科學家與機器學習工程師,同時也適合對表格基礎模型與情境學習感興趣的研究者。

Highlights

  • Zero-shot performance: 在約 80% 的 TabArena 資料集上,表現優於經過大量調校的 GBDT,且不需調整參數。
  • Scalability: 支援最多 100,000 筆訓練樣本與 2,000 個特徵的資料集,並可透過 CPU 與磁碟離線方式處理更大的資料。
  • Speed: 在某些基準測試上比 TabPFN-2.5 快 10 倍,並使用 KV 快取加速重複推論。
  • Versatility: 支援分類、回歸以及 zero‑shot 時間序列預測。
  • Explainability: 與 SHAP 整合,可進行特徵重要性分析。
  • Open Source: 包含預訓練程式碼與合成資料生成腳本。