soda-inria/tabicl
TabICLv2: A state-of-the-art tabular foundation model
What it solves
TabICL 旨在解决表格数据分类和回归的挑战,无需大量超参数调优。它提供了一种最先进的替代方案,取代传统的梯度提升决策树(GBDT)如 XGBoost、CatBoost 或 LightGBM,特别适用于训练样本数在 300 到 100,000 之间的数据集。
How it works
TabICL 是基于 Transformer 架构的表格基础模型。它使用情境学习(ICL),模型只需对预训练好的 Transformer 进行一次前向传播,即可同时在新数据上完成拟合和预测。模型在数百万个合成数据集上进行预训练,以获得通用的学习能力。为了提升在特定数据集上的表现,也支持完整的 PyTorch 训练循环进行微调。
Who it’s for
此模型适合希望获得高精度、易部署且符合 scikit‑learn 标准的表格模型的数据科学家和机器学习工程师,同时也适合对表格基础模型与情境学习感兴趣的研究者。
Highlights
- Zero-shot performance: 在约 80% 的 TabArena 数据集上,表现优于经过大量调校的 GBDT,且无需调参。
- Scalability: 支持最多 100,000 条训练样本与 2,000 个特征的数据集,并可通过 CPU 与磁盘离线方式处理更大的数据。
- Speed: 在某些基准测试上比 TabPFN-2.5 快 10 倍,并使用 KV 缓存加速重复推理。
- Versatility: 支持分类、回归以及 zero‑shot 时间序列预测。
- Explainability: 与 SHAP 集成,可进行特征重要性分析。
- Open Source: 包含预训练代码和合成数据生成脚本。