tensorflow/data-validation

Library for exploring and validating machine learning data

TensorFlow Data Validation (TFDV)

是什麼 – 一個用於幫助您探索、理解、驗證用於訓練 TensorFlow 模型的表格資料的 Python 庫。可直接整合至 TensorFlow Extended (TFX) 流水線,亦可作為獨立工具使用。

核心功能

  • 可擴展的統計 – 使用 Apache Beam 在大型資料集上計算特徵級摘要統計(平均、最小/最大值、直方圖等)。
  • 模式推論與強制 – 自動產生描述預期類型、值範圍、詞彙表及必要欄位的 TensorFlow Metadata 模式,並檢查輸入資料是否符合該模式。
  • 異常檢測 – 標記遺漏特徵、超出範圍的值、意外類型及其他資料品質問題。
  • 可視化 – 與 Facets UI 整合,並提供統計、模式及偵測到的異常的內建檢視器。
  • 分散式執行 – 小型工作可在本機執行,大型資料則可在 Cloud Dataflow 或其他 Beam 執行器上執行。

典型工作流程

  1. 匯入資料(CSV、TFRecord、Parquet 等)至 Beam 流水線。
  2. 使用 tfdv.generate_statistics_from_csv(或類似函數)產生統計資訊。
  3. 使用 tfdv.infer_schema 從統計資訊中推論模式。
  4. 透過 tfdv.validate_statistics 將新資料與模式進行驗證。
  5. 在 Facets UI 中檢查結果,或以程式方式處理異常。

安裝

pip install tensorflow-data-validation   # 穩定版本
# 或者,使用最新夜間建構版本:
export TFX_DEPENDENCY_SELECTOR=NIGHTLY
pip install --extra-index-url https://pypi-nightly.tensorflow.org/simple tensorflow-data-validation

提供 Linux 用的 Docker 鏡像,支援可重現的建構。

相依性 – 需要 TensorFlow、Apache Beam(用於分散式處理)以及 Apache Arrow(用於高效記憶體內欄式表示)。

誰應該使用它 – 需要在模型訓練或生產監控中實現可靠、自動化資料品質檢查的資料工程師與 ML 實務者,特別是在處理大型規模 TensorFlow 流水線時。

進一步閱讀 – README 中連結了入門指南、範例 Colab 記事本、API 文件,以及描述底層技術的 SysML’19 論文。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch