google-research/tabfm

TabFM (Tabular Foundation Model) is a pretrained tabular foundation model developed by Google Research for tabular data regression and classification.

解決的問題

TabFM 解決了無需為每個新數據集從頭開始訓練模型即可在表格數據集上執行分類與回歸的難題。在載入模型後,即可對具有混合列類型(數值型與類別型)的表格進行零樣本預測。

工作原理

TabFM 是一個使用上下文學習(in-context learning)的表格基礎模型。它不是透過在特定數據集上進行訓練來更新模型參數,而是將訓練數據作為「上下文」讀取,並利用這些資訊對新的測試樣本進行即時預測。它被設計為與 scikit-learn 相容,這意味著它可以輕鬆整合到現有的 Python 機器學習工作流中。

適用對象

適用於希望在無需傳統模型訓練開銷的情況下,對表格數據進行快速原型設計或預測的數據科學家與機器學習工程師。

亮點

  • 零樣本能力:無需在目標數據集上進行參數訓練即可執行分類與回歸。
  • Scikit-learn 相容性:實現了熟悉的 API (fitpredict) 以實現輕鬆整合。
  • 混合類型支援:開箱即用地處理包含數值型與類別型特徵的數據集。
  • 靈活的後端:支援使用 JAX 與 PyTorch 進行推論。
  • 上下文窗口管理:包含用於控制用於上下文學習的特徵與行數的參數,以管理記憶體與表格大小。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案