PriorLabs/TabPFN

⚡ TabPFN: Foundation Model for Tabular Data ⚡

解决的问题

TabPFN 是一种表格式基础模型,可在单次前向传播中对表格数据执行分类和回归。它消除了传统迭代训练或超参数调优的需要,无需手动数据预处理(如缩放或独热编码),即可在小到中等规模的数据集上提供高精度预测。

工作原理

TabPFN 是一种基于 Transformer 的模型,使用合成数据集进行训练。它通过将训练集作为输入的一部分,学习预测未见过的真实世界数据集的标签。该架构(特别是 TabPFN-3)利用分布嵌入器,随后是行内和跨行注意力机制,为每一行生成预测。

适用人群

适用于需要对表格数据进行快速、准确预测的数据科学家和机器学习工程师,以及通过无代码图形界面(TabPFN UX)使用的业务用户。

主要亮点

  • 零样本推理:无需迭代训练,单次前向传播即可对未见过的数据集进行预测。
  • 无需预处理:可处理缺失值,无需特征缩放或独热编码。
  • 广泛兼容:支持分类和回归任务。
  • 灵活部署:提供本地 PyTorch 实现、基于云的 API 客户端和无代码 UX。
  • 可扩展限制:TabPFN-3 支持最多 1,000,000 行和 200 个特征的数据集(行数与特征数之间存在权衡)。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目