google-research/tabfm

TabFM (Tabular Foundation Model) is a pretrained tabular foundation model developed by Google Research for tabular data regression and classification.

解决的问题

TabFM 解决了无需为每个新数据集从头开始训练模型即可在表格数据集上执行分类和回归的难题。在加载模型后,即可对具有混合列类型(数值型和类别型)的表格进行零样本预测。

工作原理

TabFM 是一个使用上下文学习(in-context learning)的表格基础模型。它不是通过在特定数据集上进行训练来更新模型参数,而是将训练数据作为“上下文”读取,并利用这些信息对新的测试样本进行即时预测。它被设计为与 scikit-learn 兼容,这意味着它可以轻松集成到现有的 Python 机器学习工作流中。

适用对象

适用于希望在无需传统模型训练开销的情况下,对表格数据进行快速原型设计或预测的数据科学家和机器学习工程师。

亮点

  • 零样本能力:无需在目标数据集上进行参数训练即可执行分类和回归。
  • Scikit-learn 兼容性:实现了熟悉的 API (fitpredict) 以实现轻松集成。
  • 混合类型支持:开箱即用地处理包含数值型和类别型特征的数据集。
  • 灵活的后端:支持使用 JAX 和 PyTorch 进行推理。
  • 上下文窗口管理:包含用于控制用于上下文学习的特征和行数的参数,以管理内存和表格大小。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目