tensorflow/data-validation

Library for exploring and validating machine learning data

TensorFlow Data Validation (TFDV)

是什么 – 一个用于帮助您探索、理解、验证用于训练 TensorFlow 模型的表格数据的 Python 库。它可直接集成到 TensorFlow Extended (TFX) 流水线中,也可作为独立工具使用。

核心功能

  • 可扩展的统计 – 使用 Apache Beam 在大规模数据集上计算特征级摘要统计(均值、最小/最大值、直方图等)。
  • 模式推断与强制 – 自动生成描述预期类型、取值范围、词汇表和必填字段的 TensorFlow Metadata 模式,并检查传入数据是否符合该模式。
  • 异常检测 – 标记缺失特征、超出范围的值、意外类型以及其他数据质量问题。
  • 可视化 – 与 Facets UI 集成,并提供用于统计、模式和检测到的异常的内置查看器。
  • 分布式执行 – 小型任务可在本地运行,大型数据任务可在 Cloud Dataflow 或其他 Beam 运行器上执行。

典型工作流程

  1. 导入数据(CSV、TFRecord、Parquet 等)到 Beam 流水线中。
  2. 使用 tfdv.generate_statistics_from_csv(或类似函数)生成统计信息。
  3. 使用 tfdv.infer_schema 从统计信息中推断模式。
  4. 通过 tfdv.validate_statistics 将新数据与模式进行验证。
  5. 在 Facets UI 中检查结果,或以编程方式处理异常。

安装

pip install tensorflow-data-validation   # 稳定版本
# 或者,使用最新夜间构建版本:
export TFX_DEPENDENCY_SELECTOR=NIGHTLY
pip install --extra-index-url https://pypi-nightly.tensorflow.org/simple tensorflow-data-validation

提供 Linux 用的 Docker 镜像,支持可复现的构建。

依赖项 – 需要 TensorFlow、Apache Beam(用于分布式处理)和 Apache Arrow(用于高效的内存列式表示)。

谁应该使用它 – 需要在模型训练或生产监控中实现可靠、自动化数据质量检查的数据工程师和 ML 实践者,尤其是在处理大规模 TensorFlow 流水线时。

进一步阅读 – README 中链接了入门指南、示例 Colab 笔记本、API 文档以及描述底层技术的 SysML’19 论文。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch