tensorflow/transform
Input pipeline framework
解決的問題
TensorFlow Transform (TFT) 解決機器學習模型的資料預處理問題,特別是需要對整個資料集進行完整遍歷以計算常數(例如平均值或詞彙)的操作。它也透過將完全相同的預處理邏輯導出為 TensorFlow 圖,並在訓練與服務階段使用,來防止「訓練-服務偏差」。
工作原理
TFT 將 TensorFlow 的標準批次層級操作擴展為支援全資料集遍歷。它使用 Apache Beam 進行高效分散式計算,並使用 Apache Arrow 作為內部資料表示,以利用向量化 numpy 函數。最終產生的轉換會被導出為 TensorFlow 圖,使預處理步驟可作為模型部署流程的一部分。
適用對象
使用 TensorFlow 並需要在大規模資料上執行複雜、全資料集預處理(例如標準化或分桶)的機器學習工程師與資料科學家。
主要特色
- 防止偏差:在訓練與服務階段均使用同一個 TensorFlow 圖,確保一致性。
- 分散式處理:由 Apache Beam 驅動,可在分散式系統中處理大型資料集。
- 全遍歷操作:支援計算平均值/標準差用於標準化、產生詞彙表用於字串轉整數、根據資料分佈建立分桶等操作。
- 向量化效能:利用 Apache Arrow 實現高效的內部資料處理。
相關
- 專案
- 專案
- 專案
- 專案
- 專案