soda-inria/tabicl
TabICLv2: An open tabular foundation model
解决的问题
TabICL 旨在消除表格分类和回归任务中繁琐的超参数调整需求。它为传统梯度提升决策树(如 XGBoost 或 CatBoost)提供了一个具有竞争力且高性能的替代方案,开箱即用且无需手动优化。
工作原理
它是一个基于 Transformer 架构的表格基础模型。它不采用传统的训练方式,而是使用上下文学习(ICL),模型利用训练数据作为上下文执行一次前向传递,以预测测试数据的结果。它在数百万个合成数据集上进行了预训练,以获取通用的学习能力。为了提升重复推理的速度,它采用了 KV 缓存机制,并针对超大数据集支持 CPU/磁盘卸载。
适用对象
处理表格数据且希望在无需耗时的超参数调整过程下获得高准确度的数据科学家与机器学习工程师,以及对表格基础模型感兴趣的研究人员。
亮点
- 零样本性能:在约 80% 的 TabArena 数据集上,表现优于经过大量调整的 XGBoost、CatBoost 或 LightGBM。
- 高速:在特定基准测试中(例如,在 H100 GPU 上处理 5 万个样本、100 个特征),速度比 TabPFN-2.5 快达 10 倍。
- 可扩展性:能够处理包含 300 到 100,000 个训练样本以及高达 2,000 个特征的数据集,并通过卸载支持更大的数据集。
- C 兼容:提供与 Scikit-learn 兼容的 API,易于集成到现有的流程中。
- 多功能性:支持分类、回归以及零样本时间序列预测。
- 可扩展性:包含用于在特定数据集上进行微调的工具以及完整的预训练方案。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch