tensorflow/model-analysis

Model analysis tools for TensorFlow

TensorFlow Model Analysis (TFMA)

是什么 – TFMA 是一个 Python 库,可让您在大规模数据集上评估 TensorFlow 模型。它重用您在训练时编写的度量标准定义,通过 Apache Beam 以分布式方式运行评估,并允许您按任意数据切片(例如按国家、按年龄组)计算度量标准,然后在 Jupyter 笔记本中探索结果。

核心功能

  • 可扩展的评估 – 可在本地机器或 Google Cloud Dataflow 等分布式运行器上运行。
  • 基于切片的度量标准 – 无需额外代码即可对任意数据切片(例如按国家、按年龄组)计算度量标准。
  • 可视化 – 内置 Jupyter 小部件和切片度量浏览器,可交互式检查结果。
  • 集成点 – 与 TFX 流水线、Kubeflow 流水线兼容,并可导出自包含的 HTML 报告。

安装

# 从 PyPI 标准安装
pip install tensorflow-model-analysis

# 夜间构建版本(如需最新版)
pip install -i https://pypi-nightly.tensorflow.org/simple tensorflow-model-analysis

# 从仓库直接安装(例如特定标签)
pip install git+https://github.com/tensorflow/model-analysis.git@v0.21.3#egg=tensorflow_model_analysis

TFMA 不会 自动拉取 TensorFlow;您必须已安装兼容的 TensorFlow 版本。

典型工作流程

  1. 在训练代码中定义度量标准(例如 tf.keras.metrics.AUC)。
  2. 创建一个 EvalConfig,指向这些度量标准,并可选择定义切片规范。
  3. 运行 TFMA – 可通过 Python API(tfma.run_model_analysis)或作为 TFX 组件运行。其内部会构建一个 Apache Beam 流水线,读取您的样本,应用模型,并聚合度量标准。
  4. 探索结果 – 打开生成的 tfma 笔记本,或在 JupyterLab 中使用 tfma 小部件浏览切片级表格和图表。

Jupyter 集成

  • 安装匹配的 JupyterLab 扩展(例如 jupyter labextension install tensorflow_model_analysis@0.32.0)。
  • 为经典 Jupyter 启用笔记本扩展(jupyter nbextension enable --py tensorflow_model_analysis)。
  • 使用提供的 tfma 小部件在笔记本中直接渲染交互式表格。

依赖项

  • TensorFlow – 核心机器学习框架。
  • Apache Beam – 支持分布式计算(默认本地运行,可针对 Dataflow、Spark、Flink 等目标)。
  • Apache Arrow – 用于高效处理内存中的列式数据。

快速入门 – 请参阅仓库的 get-started 指南: https://github.com/tensorflow/model-analysis/blob/master/g3doc/get_started.md

版本兼容性 – README 包含详细的矩阵,链接了 TFMA 发布版本与特定 TensorFlow、Apache Beam、PyArrow 及其他 TFX 组件版本之间的对应关系。请选择与您整个技术栈匹配的 TFMA 版本。

支持 – 问题可在 Stack Overflow 上通过 tensorflow-model-analysis 标签获得解答。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目