tensorflow/transform
Input pipeline framework
解决的问题
TensorFlow Transform (TFT) 解决了机器学习模型的数据预处理问题,特别是需要对整个数据集进行完整遍历以计算常量(如均值或词汇表)的操作。它通过将完全相同的预处理逻辑导出为 TensorFlow 图,并在训练和推理阶段使用,从而防止「训练-推理偏差」。
工作原理
TFT 将 TensorFlow 的标准批处理操作扩展为支持全数据集遍历。它使用 Apache Beam 实现高效的分布式计算,并使用 Apache Arrow 作为内部数据表示,以利用向量化 numpy 函数。最终生成的转换被导出为 TensorFlow 图,使预处理步骤可作为模型部署流水线的一部分。
适用人群
使用 TensorFlow 并需要在大规模数据上执行复杂、全数据集预处理(如归一化或分桶)的机器学习工程师和数据科学家。
主要亮点
- 防止偏差:在训练和推理阶段均使用同一 TensorFlow 图,确保一致性。
- 分布式处理:基于 Apache Beam,可在分布式系统中处理大规模数据集。
- 全遍历操作:支持计算均值/标准差用于归一化、生成词汇表用于字符串到整数转换、基于数据分布创建分桶等操作。
- 向量化性能:利用 Apache Arrow 实现高效的内部数据处理。
相关
- 项目
- 项目
- 项目
- 项目
- 项目