soda-inria/tabicl

TabICLv2: An open tabular foundation model

解決的問題

TabICL 旨在消除表格分類與迴歸任務中繁瑣的超參數調整需求。它為傳統梯度提升決策樹(如 XGBoost 或 CatBoost)提供了一個具競爭力且高效能的替代方案,開箱即用且無需手動優化。

運作原理

它是一個基於 Transformer 架構的表格基礎模型。它不採用傳統的訓練方式,而是使用上下文學習(ICL),模型利用訓練資料作為上下文執行一次前向傳遞,以預測測試資料的結果。它在數百萬個合成資料集上進行了預訓練,以獲取通用的學習能力。為了提升重複推論的速度,它採用了 KV 快取機制,並針對超大資料集支援 CPU/磁碟卸載。

適用對象

處理表格資料且希望在無需耗時的超參數調整過程下獲得高準確度的資料科學家與機器學習工程師,以及對表格基礎模型感興趣的研究人員。

亮點

  • 零樣本效能:在約 80% 的 TabArena 資料集上,表現優於經過大量調整的 XGBoost、CatBoost 或 LightGBM。
  • 高速:在特定基準測試中(例如,在 H100 GPU 上處理 5 萬個樣本、100 個特徵),速度比 TabPFN-2.5 快達 10 倍。
  • 可擴充性:能夠處理包含 300 到 100,000 個訓練樣本以及高達 2,000 個特徵的資料集,並透過卸載支援更大的資料集。
  • C 相容:提供與 Scikit-learn 相容的 API,易於整合至現有的流程中。
  • 多功能性:支援分類、迴歸以及零樣本時間序列預測。
  • 可擴展性:包含用於在特定資料集上進行微調的工具以及完整的預訓練方法。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch