tensorflow/data-validation
Library for exploring and validating machine learning data
TensorFlow Data Validation (TFDV)
是什麼 – 一個用於幫助您探索、理解、驗證用於訓練 TensorFlow 模型的表格資料的 Python 庫。可直接整合至 TensorFlow Extended (TFX) 流水線,亦可作為獨立工具使用。
核心功能
- 可擴展的統計 – 使用 Apache Beam 在大型資料集上計算特徵級摘要統計(平均、最小/最大值、直方圖等)。
- 模式推論與強制 – 自動產生描述預期類型、值範圍、詞彙表及必要欄位的 TensorFlow Metadata 模式,並檢查輸入資料是否符合該模式。
- 異常檢測 – 標記遺漏特徵、超出範圍的值、意外類型及其他資料品質問題。
- 可視化 – 與 Facets UI 整合,並提供統計、模式及偵測到的異常的內建檢視器。
- 分散式執行 – 小型工作可在本機執行,大型資料則可在 Cloud Dataflow 或其他 Beam 執行器上執行。
典型工作流程
- 匯入資料(CSV、TFRecord、Parquet 等)至 Beam 流水線。
- 使用
tfdv.generate_statistics_from_csv(或類似函數)產生統計資訊。 - 使用
tfdv.infer_schema從統計資訊中推論模式。 - 透過
tfdv.validate_statistics將新資料與模式進行驗證。 - 在 Facets UI 中檢查結果,或以程式方式處理異常。
安裝
pip install tensorflow-data-validation # 穩定版本
# 或者,使用最新夜間建構版本:
export TFX_DEPENDENCY_SELECTOR=NIGHTLY
pip install --extra-index-url https://pypi-nightly.tensorflow.org/simple tensorflow-data-validation
提供 Linux 用的 Docker 鏡像,支援可重現的建構。
相依性 – 需要 TensorFlow、Apache Beam(用於分散式處理)以及 Apache Arrow(用於高效記憶體內欄式表示)。
誰應該使用它 – 需要在模型訓練或生產監控中實現可靠、自動化資料品質檢查的資料工程師與 ML 實務者,特別是在處理大型規模 TensorFlow 流水線時。
進一步閱讀 – README 中連結了入門指南、範例 Colab 記事本、API 文件,以及描述底層技術的 SysML’19 論文。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch