pyg-team/pytorch-frame

Tabular Deep Learning Library for PyTorch

解決的問題

PyTorch Frame 提供了一個模組化框架,專為處理包含文字、影像、數值等混合欄位類型的異質表格資料而設計,用於建立深度學習模型。它克服了傳統樹狀模型(如 GBDT)的限制,支援與下游模型更佳的整合,並能處理文字、影像、時間戳記等複雜欄位類型,同時兼顧數值與分類資料。

作用方式

此套件採用由三個主要元件組成的模組化架構:

  1. Materialization:將原始的 pandas DataFrame 轉換為適合 PyTorch 訓練的 TensorFrame 格式。
  2. FeatureEncoder:將各種欄位類型編碼為一致大小的隱藏嵌入。
  3. TableConv:建模這些欄位嵌入之間的互動。
  4. Decoder:對嵌入進行池化,產生每列的最終預測或嵌入。

支援與 LLM 嵌入 API(如 OpenAI、Cohere、Voyage AI)以及 Hugging Face transformers 集成,用於編碼文字資料。

適用對象

專為希望實驗深度表格模型,或使用標準化、模組化方法與 GBDT 進行效能比較的深度學習研究人員與實務工作者設計。

主要特色

  • 多樣欄位類型支援:支援數值、分類、多分類、文字(嵌入或分詞)、時間戳記與影像。
  • 預先實作模型:包含 Trompt、FTTransformer、TabNet、ExcelFormer 與 TabTransformer 等先進模型。
  • PyTorch 生態系統整合:可與其他 PyTorch 套件(如用於關係資料庫學習的 PyG)無縫整合。
  • 基準資料集:提供一系列即用型表格資料集與基準測試工具,用於比較深度學習模型與 GBDT 的表現。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案