tensorflow/transform

Input pipeline framework

解决的问题

TensorFlow Transform (TFT) 解决了机器学习模型的数据预处理问题,特别是需要对整个数据集进行完整遍历以计算常量(如均值或词汇表)的操作。它通过将完全相同的预处理逻辑导出为 TensorFlow 图,并在训练和推理阶段使用,从而防止「训练-推理偏差」。

工作原理

TFT 将 TensorFlow 的标准批处理操作扩展为支持全数据集遍历。它使用 Apache Beam 实现高效的分布式计算,并使用 Apache Arrow 作为内部数据表示,以利用向量化 numpy 函数。最终生成的转换被导出为 TensorFlow 图,使预处理步骤可作为模型部署流水线的一部分。

适用人群

使用 TensorFlow 并需要在大规模数据上执行复杂、全数据集预处理(如归一化或分桶)的机器学习工程师和数据科学家。

主要亮点

  • 防止偏差:在训练和推理阶段均使用同一 TensorFlow 图,确保一致性。
  • 分布式处理:基于 Apache Beam,可在分布式系统中处理大规模数据集。
  • 全遍历操作:支持计算均值/标准差用于归一化、生成词汇表用于字符串到整数转换、基于数据分布创建分桶等操作。
  • 向量化性能:利用 Apache Arrow 实现高效的内部数据处理。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目